Aller au contenu principal
Zubnet AIApprendre › Wiki

AI Wiki

Concepts AI expliqués par des builders, pas des manuels. Pas de murs de jargon. Pas de gatekeeping académique. Des définitions claires et pratiques des termes que tu vas vraiment rencontrer.

339 termes 8 catégories Mis à jour juillet 2026
💡
Terme du jour
Loading...
🧭 Parcours d'apprentissage
Aucun terme trouvé.
A
Annotation
Étiquetage de données, annotation de données
Entraînement
Le processus d'ajout d'étiquettes, de tags ou de métadonnées à des données brutes pour qu'elles puissent être utilisées pour l'apprentissage supervisé. Annoter des images signifie dessiner des boîtes englobantes autour des objets. Annoter du texte signifie étiqueter les entités, le sentiment ou l'intention. Annoter pour le RLHF signifie classer les réponses du modèle par qualité. L'annotation est le travail humain qui transforme les données brutes en données d'entraînement.
Pourquoi c'est important : L'annotation est le fondement peu glamour de l'IA supervisée. Chaque jeu de données étiquetées, chaque modèle ajusté, chaque assistant aligné dépend d'annotateurs humains qui ont passé des heures à étiqueter correctement les données. La qualité des annotations détermine directement la qualité du modèle — un étiquetage incohérent ou biaisé produit des modèles incohérents et biaisés. C'est la partie la plus intensive en main-d'œuvre et souvent la plus coûteuse de la construction de systèmes d'IA.
Apprentissage continu
Apprentissage tout au long de la vie, apprentissage incrémental
Entraînement
La capacité d'un modèle à apprendre de nouvelles données en continu sans oublier ce qu'il a appris avant. Les LLM actuels sont entraînés une fois et figés — les mettre à jour nécessite un réentraînement coûteux. L'apprentissage continu permettrait aux modèles d'apprendre de chaque interaction, de rester à jour avec les nouvelles informations et de s'adapter aux utilisateurs individuels, comme les humains apprennent naturellement.
Pourquoi c'est important : L'apprentissage continu est l'un des grands problèmes non résolus de l'IA. Les modèles actuels ont des dates de coupure de connaissances, ne peuvent pas apprendre des corrections, et traitent chaque conversation comme une page blanche. Résoudre l'apprentissage continu éliminerait le besoin de cycles de réentraînement coûteux, permettrait une IA personnalisée qui s'adapte véritablement à chaque utilisateur, et permettrait aux modèles de rester perpétuellement à jour.
Apprentissage fédéré
FL, apprentissage collaboratif
Entraînement
Une approche d'entraînement où le modèle est entraîné sur plusieurs appareils ou organisations sans partager les données brutes. Au lieu d'envoyer les données à un serveur central, chaque participant entraîne une copie locale du modèle sur ses propres données et envoie seulement les mises à jour du modèle (gradients) à un coordinateur central. Le coordinateur agrège les mises à jour de tous les participants pour améliorer le modèle global.
Pourquoi c'est important : L'apprentissage fédéré permet l'entraînement d'IA sur des données qui ne peuvent pas être centralisées pour des raisons de confidentialité, de réglementation ou de concurrence. Des hôpitaux peuvent collaborativement entraîner un modèle de diagnostic sans partager les dossiers des patients. Des entreprises peuvent améliorer un modèle partagé sans exposer leurs données propriétaires. C'est l'approche la plus pratique pour l'entraînement d'IA respectueux de la vie privée à grande échelle.
Une stratégie d'entraînement qui présente les exemples dans un ordre significatif — typiquement du facile au difficile — plutôt qu'aléatoirement. Comme enseigner l'arithmétique avant le calcul intégral à un élève, l'apprentissage par curriculum donne d'abord les patterns fondamentaux au modèle et augmente la complexité graduellement. Ça peut mener à une convergence plus rapide et parfois à de meilleures performances finales.
Pourquoi c'est important : L'apprentissage par curriculum est une technique sous-estimée qui peut améliorer l'efficacité d'entraînement sans changer le modèle ou les données. Le pré-entraînement des LLM utilise de plus en plus le scheduling de données — montrer des données plus propres et de meilleure qualité dans les dernières étapes d'entraînement — ce qui est une forme d'apprentissage par curriculum. L'ordre dans lequel tu présentes les données compte, pas seulement les données elles-mêmes.
ASI
Superintelligence Artificielle
Fondamentaux
Un système d'IA théorique qui dépasse les capacités cognitives de tous les humains dans presque tous les domaines — raisonnement scientifique, intelligence sociale, créativité, planification stratégique, etc. L'ASI dépasse l'AGI (qui correspond à l'intelligence humaine) pour atteindre quelque chose de qualitativement différent : une intelligence capable de s'améliorer de manière récursive et de résoudre des problèmes que les humains ne pourraient même pas formuler. Aucune ASI n'existe, et il n'y a pas de consensus scientifique sur le fait qu'elle puisse ou non être construite.
Pourquoi c’est important : ASI est le domaine où la sécurité de l'intelligence artificielle prend une dimension existentielle. Si vous croyez que l'intelligence surhumaine est possible, l'alignement n'est pas seulement question de rendre les chatbots polis — il s'agit d'assurer qu'un système plus intelligent que toute l'humanité agisse toujours dans notre intérêt. C'est spéculatif, mais les enjeux sont suffisamment élevés pour que des chercheurs sérieux y portent une attention sérieuse. Comprendre l'ASI vous permet d'évaluer les affirmations sur les risques de l'intelligence artificielle avec plus de nuance.
AGI
Intelligence Artificielle Générale
Fondamentaux
Un système hypothétique d'intelligence artificielle capable de comprendre, d'apprendre et d'exécuter toute tâche intellectuelle qu'un humain peut accomplir — avec la capacité de transférer des connaissances d'un domaine à un autre sans avoir été spécifiquement entraîné pour chacun. Contrairement à l'IA actuelle, qui excelle dans des tâches spécialisées (génération de texte, classification d'images), l'IA générale (AGI) gérerait des situations nouvelles, raisonnerait de manière abstraite et s'adapterait à tout défi. Que l'AGI soit imminente, à des décennies de distance ou impossible constitue le débat le plus contentieux dans le domaine.
Pourquoi c’est important : L'IA générale (AGI) est l'étoile polaire (ou le cauchemar) de toute l'industrie de l'intelligence artificielle. Elle fait déplacer des milliards de dollars d'investissements, définit les priorités de recherche en matière de sécurité et domine les débats politiques. Quelle que soit votre opinion sur la proximité de l'AGI, ce concept détermine la manière dont des entreprises comme Anthropic, OpenAI et DeepMind définissent leurs missions — et comprendre ce débat vous permet de distinguer les progrès réels des provocations.
Assistants de codage IA
Code Copilot, IDE IA
Outils
Des outils d'IA qui aident les développeurs à écrire, réviser, déboguer et déployer du code. De l'autocomplétion (GitHub Copilot, Codeium) au développement entièrement autonome (Claude Code, Cursor, Devin), les assistants de code représentent l'une des applications les plus matures et les plus largement adoptées des LLM. Ils fonctionnent en prédisant les prochains tokens de code à partir du contexte de votre base de code, de la documentation et des instructions.
Pourquoi c’est important : Les assistants de code IA sont le tranchant le plus aiguisé de l'impact de l'IA sur le travail intellectuel. Les développeurs qui les utilisent rapportent des gains de productivité de 30 à 50 % sur les tâches de routine. Mais ils hallucinent aussi des API qui n'existent pas, introduisent des bogues subtils et peuvent rendre les développeurs dépendants d'outils qu'ils ne comprennent pas entièrement.
Automatisation
Automatisation IA, automatisation des workflows
Outils
Utiliser l'IA pour effectuer des tâches qui nécessitaient auparavant une intervention humaine. Cela va de l'automatisation simple (catégorisation automatique de courriels, génération de rapports) aux flux de travail autonomes complexes (agents IA qui recherchent, rédigent, testent et déploient du code). Le changement clé de l'automatisation traditionnelle (règles rigides) à l'automatisation par IA (intelligence flexible) est que l'IA peut gérer des tâches ambiguës et non structurées.
Pourquoi c’est important : L'automatisation est le moteur économique de l'adoption de l'IA. Chaque entreprise qui achète de l'IA achète en réalité de l'automatisation — moins d'humains effectuant du travail répétitif, un traitement plus rapide, un fonctionnement 24 heures sur 24. La question n'est pas de savoir si l'IA automatisera des tâches, mais lesquelles, à quelle vitesse, et ce qu'il adviendra des humains qui les effectuaient.
IA en cybersécurité
Cybersécurité IA, détection de menaces par IA
Sécurité
La double application de l'IA en cybersécurité : utiliser l'IA pour défendre les systèmes (détection de menaces, détection d'anomalies, réponse automatisée aux incidents) et les nouveaux vecteurs d'attaque que l'IA crée (hameçonnage généré par IA, découverte automatisée de vulnérabilités, attaques adverses contre les systèmes d'apprentissage automatique). Le domaine est engagé dans une course aux armements où attaquants et défenseurs sont de plus en plus propulsés par l'IA.
Pourquoi c’est important : L'IA rend les cybermenaces existantes plus rapides et moins chères à exécuter — un courriel d'hameçonnage rédigé par un LLM est plus convaincant et ne coûte rien à personnaliser. Mais l'IA permet aussi des défenses qui seraient impossibles manuellement, comme analyser des millions d'événements réseau par seconde pour détecter des anomalies. Les équipes de sécurité qui n'utilisent pas l'IA perdront face aux attaquants qui l'utilisent.
Gouvernance de l'IA
Réglementation de l'IA, politique d'IA
Sécurité
Les cadres, politiques, lois et pratiques organisationnelles qui encadrent la façon dont l'IA est développée, déployée et utilisée. Cela inclut la réglementation gouvernementale (l'AI Act européen, les décrets exécutifs), l'autorégulation de l'industrie (politiques de mise à l'échelle responsable, fiches de modèle), la gouvernance d'entreprise (comités d'éthique de l'IA, politiques d'utilisation) et la coordination internationale sur les normes de sécurité de l'IA.
Pourquoi c’est important : La technologie avance plus vite que les règles. Les entreprises livrent des produits d'IA dans les domaines de la santé, de la justice pénale et de la finance avec un encadrement minimal. La gouvernance est la tentative d'établir des limites avant que quelque chose ne se brise assez gravement pour déclencher un contrecoup qui pourrait faire reculer tout le domaine.
Confidentialité en IA
Confidentialité des données en IA, confidentialité ML
Sécurité
Le défi de construire et d'utiliser des systèmes d'IA sans compromettre les données personnelles. Cela couvre l'ensemble du cycle de vie : les données d'entraînement qui pourraient contenir des informations privées, les modèles qui peuvent mémoriser et régurgiter des détails personnels, les journaux d'inférence qui suivent le comportement des utilisateurs, et la tension fondamentale entre la capacité de l'IA (qui s'améliore avec plus de données) et les droits à la vie privée.
Pourquoi c’est important : Chaque conversation avec une IA est une donnée. Chaque image que vous générez révèle vos instructions. Chaque document que vous résumez passe par les serveurs de quelqu'un. La vie privée n'est pas juste une case à cocher juridique (RGPD, CCPA) — c'est une question de confiance qui détermine si les individus et les entreprises adopteront l'IA pour le travail sensible.
Sécurité de l'IA
Sécurité des LLM, ingénierie de la sûreté de l'IA
Sécurité
La pratique de protéger les systèmes d'IA contre les attaques adverses, l'empoisonnement de données, l'injection de prompts, le vol de modèles et l'utilisation abusive — tout en se défendant contre les menaces propulsées par l'IA comme les hypertrucages et les cyberattaques automatisées. La sécurité de l'IA se situe à l'intersection de la cybersécurité traditionnelle et des vulnérabilités uniques introduites par les systèmes d'apprentissage automatique.
Pourquoi c’est important : Les systèmes d'IA sont simultanément des outils puissants et des surfaces d'attaque inédites. Une injection de prompt peut faire fuiter des données internes par votre bot de support client. Un ensemble de données d'entraînement empoisonné peut insérer des portes dérobées. À mesure que l'IA est déployée dans les infrastructures critiques, la santé et la finance, la sécurité n'est pas optionnelle — elle est existentielle.
Tarification de l'IA
Tarification au token, tarification API
Infrastructure
Comment les fournisseurs d'IA facturent l'accès à leurs modèles. Le modèle dominant est la tarification par token — vous payez pour le nombre de tokens que vous envoyez (entrée) et recevez (sortie), les tokens de sortie coûtant typiquement 3 à 5 fois plus. D'autres modèles incluent la tarification par requête, les abonnements mensuels, les remises sur engagement et les niveaux gratuits. La course à la baisse des prix a été féroce, avec des coûts en chute de 10 à 100 fois en deux ans.
Pourquoi c’est important : La tarification détermine ce que vous pouvez construire. Une application qui fait 10 000 appels API par jour vit ou meurt par le coût par token. Comprendre les modèles de tarification, comparer les fournisseurs et optimiser l'utilisation des tokens est une compétence essentielle pour quiconque construit des produits propulsés par l'IA.
Infrastructure IA
Infra IA, infrastructure ML
Infrastructure
La pile complète de matériel, de logiciels et de services nécessaires pour entraîner et déployer des modèles d'IA à grande échelle. Cela inclut les GPU et les puces sur mesure, les centres de données, le réseau, le stockage, les plateformes d'orchestration (Kubernetes, Slurm), les cadres de service de modèles (vLLM, TensorRT) et les fournisseurs infonuagiques qui empaquettent le tout. L'infrastructure IA est le lieu où le monde abstrait de l'architecture de modèles rencontre le monde très concret des réseaux électriques et des systèmes de refroidissement.
Pourquoi c’est important : L'infrastructure détermine ce qui est possible. La raison pour laquelle seule une poignée d'entreprises peut entraîner des modèles de pointe n'est pas un manque d'idées — c'est un manque d'infrastructure. Et la raison pour laquelle l'IA coûte ce qu'elle coûte pour les utilisateurs finaux remonte directement à la disponibilité des GPU, à la capacité des centres de données et à l'efficacité du service d'inférence.
AssemblyAI
Universal-2 STT, intelligence audio
Compagnies
Entreprise de reconnaissance vocale qui développe des API conviviales pour les développeurs, couvrant la transcription, la détection de locuteurs et la compréhension audio. Leur modèle Universal-2 rivalise avec OpenAI Whisper en précision, tout en ajoutant des fonctionnalités comme la diarisation, l'analyse de sentiment et la détection de sujets directement intégrées.
Pourquoi c’est important : AssemblyAI a rendu la reconnaissance vocale véritablement accessible aux développeurs, condensant ce qui nécessitait auparavant une équipe dédiée en apprentissage automatique en un seul appel API. Leur pile Audio Intelligence — combinant transcription, identification de locuteurs, analyse de sentiment et synthèse propulsée par des grands modèles de langage — transforme l'audio brut en données structurées et exploitables à une échelle qui n'était pas envisageable il y a seulement deux ans. Dans un monde où la voix devient l'interface par défaut des agents IA, AssemblyAI construit la couche de compréhension dont tout le reste dépend.
Anthropic
Claude, IA constitutionnelle, MCP
Compagnies
Entreprise de sécurité en IA qui développe Claude. Fondée par d'anciens chercheurs d'OpenAI, Dario et Daniela Amodei, Anthropic se concentre sur le développement de systèmes d'IA fiables, interprétables et orientables.
Pourquoi c’est important : Anthropic a prouvé qu'une entreprise d'IA pouvait placer la recherche en sécurité au premier plan tout en restant compétitive à la frontière technologique. Leur approche Constitutional AI a influencé la façon dont l'ensemble de l'industrie pense l'alignement, leur Responsible Scaling Policy a établi un modèle que d'autres laboratoires ont adopté sous diverses formes, et Claude est devenu le modèle de choix pour les entreprises qui ont besoin de fiabilité et de traitement soigné des contenus sensibles. Peut-être plus important encore, l'existence d'Anthropic comme concurrent bien financé garantit que la course vers l'AGI n'est pas l'affaire d'une seule entreprise — et qu'au moins un acteur majeur porte la sécurité dans son ADN fondateur plutôt que comme un ajout après coup.
Alibaba Cloud
Modèles Qwen, Tongyi Qianwen
Compagnies
La division d'infonuagique du Groupe Alibaba et créatrice de la famille de modèles Qwen. Les modèles Qwen sont entièrement à poids ouverts, multilingues et comptent parmi les modèles ouverts les plus performants disponibles.
Pourquoi c’est important : Alibaba Cloud a fait de Qwen la famille de modèles à poids ouverts la plus largement déployée en Asie et un concurrent mondial véritablement crédible face à Llama de Meta, prouvant que des modèles de classe frontière peuvent provenir de l'extérieur de la Silicon Valley. Leur combinaison de publications de modèles ouverts, d'infrastructure infonuagique massive et de l'écosystème ModelScope offre aux développeurs — en particulier ceux des marchés touchés par les contrôles à l'exportation américains — une alternative crédible et de haute qualité aux plateformes d'IA occidentales.
Agent
Agent IA
Outils
Un système d'IA qui peut planifier et exécuter de manière autonome des tâches en plusieurs étapes, en utilisant des outils (recherche web, exécution de code, appels API) pour atteindre un objectif. Contrairement à un simple chatbot qui répond à une question à la fois, un agent décide quoi faire ensuite en fonction de ce qu'il a appris jusqu'ici.
Pourquoi c’est important : Les agents sont le pont entre « l'IA qui parle » et « l'IA qui agit ». Quand votre IA peut consulter de la documentation, écrire du code et le tester sans que vous la guidiez à chaque étape — c'est un agent.
Sécurité
Le défi de faire en sorte que les systèmes d'IA se comportent conformément aux valeurs et aux intentions humaines. Un modèle aligné fait ce que vous voulez dire, pas seulement ce que vous avez dit — et évite les actions nuisibles même quand on ne lui a pas explicitement dit de ne pas le faire.
Pourquoi c’est important : Un modèle techniquement brillant mais mal aligné est comme un employé génial qui suit les instructions trop littéralement. La recherche en alignement est la raison pour laquelle les modèles refusent les demandes dangereuses et essaient d'être véritablement utiles.
API
Interface de programmation d'application
Infrastructure
Un moyen structuré pour les logiciels de communiquer entre eux. En IA, cela signifie généralement envoyer une requête (votre prompt) au serveur d'un fournisseur et recevoir une réponse (la sortie du modèle) en retour. Les API REST via HTTPS sont la norme.
Pourquoi c’est important : Chaque fournisseur d'IA — Anthropic, Google, Mistral — expose ses modèles via des API. Si vous construisez quoi que ce soit avec l'IA au-delà d'une fenêtre de chat, vous utilisez une API.
Attention
Mécanisme d'attention, auto-attention
Modèles
Le mécanisme central des Transformers qui permet à un modèle d'évaluer quelles parties de l'entrée sont les plus pertinentes les unes pour les autres. Au lieu de lire le texte de gauche à droite comme les anciens modèles, l'attention permet à chaque mot de « regarder » simultanément tous les autres mots pour comprendre le contexte.
Pourquoi c’est important : L'attention est la raison pour laquelle les LLM modernes comprennent que « banque » signifie des choses différentes dans « la berge de la rivière » et « le compte en banque ». C'est aussi pourquoi les fenêtres de contexte plus longues coûtent plus cher — l'attention croît quadratiquement avec la longueur de la séquence.
Autorégressif
Prédiction du prochain token
Un modèle qui génère sa sortie un token à la fois, où chaque nouveau token est prédit en fonction de tous les tokens précédents. Chaque LLM moderne — Claude, GPT, Llama, Gemini — est autorégressif.
Pourquoi c'est important : Comprendre la génération autorégressive explique la plupart des comportements des LLM : pourquoi les réponses arrivent token par token, pourquoi les modèles se contredisent parfois en plein paragraphe, pourquoi les sorties plus longues sont plus lentes et plus chères.
Intelligence artificielle
IA, intelligence machine
Le vaste domaine de la construction de machines capables d'effectuer des tâches nécessitant typiquement l'intelligence humaine — comprendre le langage, reconnaître des images, prendre des décisions, résoudre des problèmes. L'IA va de systèmes étroits qui excellent dans une tâche spécifique (filtres anti-spam, moteurs d'échecs) jusqu'à l'objectif ambitieux d'une intelligence générale capable de gérer toute tâche intellectuelle qu'un humain peut accomplir.
Pourquoi c'est important : L'IA est le parapluie qui couvre tout le reste dans ce wiki — apprentissage automatique, apprentissage profond, LLM, vision par ordinateur, robotique. Comprendre que « IA » est un spectre, des simples systèmes à règles jusqu'aux modèles de langage de pointe, t'aide à évaluer les affirmations, couper à travers le battage médiatique et comprendre ce que sont réellement les systèmes actuels : des détecteurs de patterns extraordinairement capables, pas des machines pensantes.
Fonction d'activation
ReLU, GELU, SiLU, Swish
Une fonction mathématique appliquée à la sortie d'un neurone qui introduit de la non-linéarité dans le réseau. Sans fonctions d'activation, un réseau de neurones — peu importe le nombre de couches — ne pourrait apprendre que des relations linéaires. ReLU, GELU et SiLU/Swish sont les plus courants dans les architectures modernes.
Pourquoi c'est important : Les fonctions d'activation sont la raison pour laquelle l'apprentissage profond fonctionne. Un empilement de transformations linéaires n'est qu'une seule grande transformation linéaire. Les fonctions d'activation entre les couches permettent au réseau d'apprendre des patterns complexes et non linéaires — les courbes, contours et relations subtiles qui rendent les réseaux de neurones puissants.
Éthique de l'IA
IA responsable, IA éthique
L'étude des questions morales soulevées par le développement et le déploiement de l'IA : quels biais les systèmes d'IA perpétuent-ils? Qui est lésé quand l'IA fait des erreurs? Comment les décisions de l'IA devraient-elles être expliquées? Qui est responsable quand un système autonome cause des dommages? L'éthique de l'IA englobe l'équité, la transparence, la responsabilité, la vie privée et l'impact sociétal des systèmes d'IA.
Pourquoi c'est important : Les systèmes d'IA prennent des décisions affectant l'embauche, le crédit, la justice pénale, les soins de santé et la modération de contenu pour des milliards de personnes. Ces décisions encodent des valeurs — quelles données ont été incluses, quels résultats ont été optimisés, qui a été consulté. L'éthique de l'IA n'est pas un exercice philosophique abstrait; c'est la question pratique de savoir si les systèmes d'IA rendent le monde plus juste ou moins.
Réglementation de l'IA
EU AI Act, politique d'IA
Les lois et politiques régissant le développement et le déploiement des systèmes d'IA. L'EU AI Act (2024) est le plus complet, classant les systèmes d'IA par niveau de risque et imposant des exigences en conséquence. Les États-Unis ont adopté une approche plus sectorielle avec des décrets et des directives d'agences. La Chine a des réglementations ciblant l'IA générative, les deepfakes et les algorithmes de recommandation.
Pourquoi c'est important : La réglementation façonne ce que les entreprises d'IA peuvent construire, comment elles doivent le construire et ce qu'elles doivent divulguer. L'EU AI Act affecte toute entreprise servant des utilisateurs européens. Comprendre le paysage réglementaire est de plus en plus nécessaire pour quiconque construit ou déploie de l'IA — la non-conformité peut signifier des amendes, des interdictions ou de la responsabilité civile.
Le système d'IA sur appareil et dans le cloud d'Apple, intégré sur iPhone, iPad et Mac. Apple Intelligence fait tourner des modèles plus petits localement sur Apple Silicon pour les tâches sensibles à la vie privée (réécriture de texte, résumé, génération d'images) et route les requêtes complexes vers les serveurs Private Cloud Compute d'Apple. Il intègre aussi des modèles externes (comme ChatGPT) avec le consentement de l'utilisateur pour les tâches au-delà de ses propres capacités.
Pourquoi c'est important : Apple Intelligence représente la stratégie IA grand public de la société la plus valorisée au monde, touchant plus d'un milliard d'appareils. Son accent sur la vie privée (traitement sur l'appareil, Private Cloud Compute avec sécurité vérifiable) offre un modèle différent de l'approche cloud-first d'OpenAI et Google. Si Apple réussit son IA, ça normalise l'IA sur appareil pour des milliards d'utilisateurs non techniques.
Une entreprise d'IA israélienne connue pour Jamba, la première architecture hybride de qualité production qui combine des couches d'attention Transformer avec des couches SSM Mamba. AI21 a été fondée par des chercheurs en IA (incluant Yoav Shoham) et construit des modèles de langage depuis 2017, avant ChatGPT. Leurs modèles sont disponibles via API et les fournisseurs cloud.
Pourquoi c'est important : AI21 Labs compte parce que Jamba a prouvé que les architectures hybrides Transformer-SSM fonctionnent en pratique, pas seulement dans les articles de recherche. En intercalant des couches d'attention et Mamba, Jamba atteint une fenêtre de contexte de 256K avec une utilisation mémoire plus faible que les modèles purement Transformer de qualité similaire. Cette approche hybride pourrait être l'avenir de l'architecture LLM.
Fondamentaux
Une période de réduction du financement, de l'intérêt et des progrès en recherche IA suivant un cycle d'engouement et d'attentes non satisfaites. Il y a eu deux hivers majeurs de l'IA : le premier du milieu des années 1970 au début des années 1980 (après l'échec de la mise à l'échelle des systèmes experts), et le second de la fin des années 1980 au milieu des années 1990 (après que les réseaux de neurones ont atteint les limites computationnelles). Chacun a été précédé par un optimisme débridé et suivi par la désillusion.
Pourquoi c’est important : Comprendre les hivers de l'IA fournit un contexte essentiel pour évaluer les affirmations actuelles sur l'IA. Le pattern — percée, engouement, promesses excessives, sous-performance, effondrement du financement — s'est répété deux fois. Que le boom actuel du deep learning suive le même schéma ou le brise est la question la plus importante en IA. La meilleure défense contre un autre hiver est une évaluation honnête de ce que les systèmes actuels peuvent et ne peuvent pas faire.
Agent autonome
Agent IA, IA agentique
Utiliser l'IA
Un système d'IA qui peut planifier, décider et exécuter de manière indépendante des tâches en plusieurs étapes avec un minimum de supervision humaine. Étant donné un objectif de haut niveau (« rechercher les concurrents et rédiger un rapport »), un agent autonome le décompose en étapes, utilise des outils (recherche web, exécution de code, gestion de fichiers), gère les erreurs et livre un résultat. Le niveau d'autonomie va de « demander la permission à chaque étape » à « fait-le et rends compte ».
Pourquoi c’est important : Les agents autonomes sont la prochaine évolution au-delà des chatbots et des copilotes. Un chatbot répond à des questions. Un copilote assiste avec les tâches. Un agent complète des tâches de manière indépendante. Le potentiel économique est énorme — des agents capables de gérer le travail intellectuel routinier (recherche, analyse de données, service client, revue de code) à une fraction du coût et du temps. Mais les défis de fiabilité et de sécurité restent significatifs.
Flux agentique
Aussi appelé : Architecture d'agent, workflow IA
Utiliser l'IA
Un pattern de conception où des agents IA orchestrent des processus en plusieurs étapes — planifier, exécuter des outils, évaluer les résultats et itérer — pour accomplir des tâches complexes. Contrairement à un simple échange prompt-réponse, les flux agentiques impliquent des boucles : l'agent agit, observe le résultat, décide quoi faire ensuite, et continue jusqu'à ce que la tâche soit complète ou qu'il ait besoin d'intervention humaine.
Pourquoi c’est important : Les flux agentiques sont la façon dont l'IA passe de « répondre aux questions » à « faire le travail ». Un chatbot répond à une question à la fois. Un flux agentique recherche un sujet, rédige un brouillon, le révise pour la précision et le corrige — le tout de façon autonome. Ce pattern émerge dans la génération de code (Cursor, Claude Code), la recherche (Perplexity, Deep Research) et l'automatisation d'entreprise.
Benchmarks IA
Aussi appelé : MMLU, HumanEval, ARC, HellaSwag
Fondamentaux
Des tests standardisés utilisés pour mesurer et comparer les capacités des modèles d'IA. MMLU teste les connaissances dans 57 matières académiques. HumanEval teste la génération de code. ARC teste le raisonnement scientifique. HellaSwag teste le raisonnement de bon sens. GSM8K teste les mathématiques. Les scores de benchmarks fournissent un langage commun pour comparer les modèles, bien qu'ils aient des limitations significatives.
Pourquoi c’est important : Les benchmarks sont la façon dont l'industrie tient le score. Quand Anthropic dit que Claude obtient X % sur MMLU et Y % sur HumanEval, ces chiffres n'ont de sens que si tu sais ce que les benchmarks testent, comment ils sont notés et quelles sont leurs limitations. Comprendre les benchmarks t'aide à voir au-delà des claims marketing et à évaluer quel modèle est vraiment le meilleur pour ton cas d'usage spécifique.
Modèles
Le réseau de neurones convolutionnel qui a remporté la compétition ImageNet 2012 avec une marge massive, déclenchant la révolution de l'apprentissage profond. Créé par Alex Krizhevsky, Ilya Sutskever et Geoffrey Hinton, AlexNet a réduit le taux d'erreur de classification d'images de 26% à 16% — un écart si grand qu'il a convaincu la communauté de la vision par ordinateur que l'apprentissage profond était fondamentalement supérieur aux features conçues à la main.
Pourquoi c’est important : AlexNet est le moment "avant et après" de l'histoire de l'IA. Avant 2012, la plupart des chercheurs en IA travaillaient sur l'ingénierie de features et les méthodes non neuronales. Après AlexNet, l'apprentissage profond est devenu le paradigme dominant. Chaque système d'IA moderne — GPT, Claude, Stable Diffusion — tire sa lignée du changement de paradigme qu'AlexNet a déclenché. C'est le Big Bang de l'IA moderne.
Fondamentaux
Exécuter plusieurs opérations d'attention en parallèle, chacune avec sa propre projection apprise des queries, keys et values. Au lieu d'une seule fonction d'attention qui regarde la dimension complète du modèle, l'attention multi-tête divise la dimension en plusieurs "têtes" (ex : 32 têtes de 128 dimensions chacune pour un modèle de 4096 dimensions). Chaque tête peut se concentrer sur différents types de relations simultanément.
Pourquoi c'est important : L'attention multi-tête est la raison pour laquelle les Transformers sont si expressifs. Une tête peut se concentrer sur les relations syntaxiques (sujet-verbe), une autre sur les patterns positionnels (mots proches), une autre sur la similarité sémantique. Cette spécialisation parallèle permet au modèle de capturer de nombreux types de dépendances simultanément, ce qu'une seule tête d'attention ne peut pas faire aussi efficacement.
Modèles
Un réseau de neurones entraîné à reconstruire les activations internes d'un modèle à travers un goulot d'étranglement avec une contrainte de parcimonie — seules quelques features peuvent être actives à la fois. Les features apprises correspondent souvent à des concepts interprétables (sujets spécifiques, patterns linguistiques, stratégies de raisonnement), faisant des SAE l'outil principal pour démêler les features superposées à l'intérieur des grands modèles de langage.
Pourquoi c'est important : Les auto-encodeurs épars sont le microscope de l'interprétabilité mécaniste. Les LLM empaquettent des milliers de features dans chaque couche par superposition, rendant les neurones individuels ininterprétables. Les SAE décomposent ces représentations superposées en features individuelles et interprétables. Anthropic a utilisé les SAE pour identifier des millions de features dans Claude, incluant des features pour la tromperie, des concepts spécifiques et des comportements liés à la sécurité.
Entraînement
Une approche d'apprentissage auto-supervisé qui entraîne les modèles en contrastant des paires positives (items similaires qui devraient être proches dans l'espace d'embedding) avec des paires négatives (items dissimilaires qui devraient être éloignés). CLIP contraste les paires image-texte correspondantes avec les non correspondantes. SimCLR contraste les vues augmentées de la même image avec les vues d'images différentes. Le modèle apprend des représentations où la similarité dans l'espace d'embedding reflète la similarité du monde réel.
Pourquoi c'est important : L'apprentissage contrastif est la façon dont la plupart des modèles d'embedding sont entraînés — les modèles qui alimentent la recherche sémantique, le RAG et les recommandations. C'est aussi l'approche d'entraînement derrière CLIP, qui connecte le langage et la vision. Chaque fois que tu utilises des embeddings pour mesurer la similarité, l'apprentissage contrastif est probablement la façon dont ces embeddings ont été créés.
Optimiseur Adam
Adam, AdamW
Entraînement
L'algorithme d'optimisation le plus utilisé pour l'entraînement des réseaux de neurones. Adam (Adaptive Moment Estimation) combine le momentum (utilisant une moyenne mobile des gradients passés) avec des taux d'apprentissage adaptatifs (mettant à l'échelle les mises à jour par l'inverse des magnitudes des gradients passés). AdamW ajoute un déclin de poids découplé pour une meilleure régularisation. Pratiquement tous les LLM modernes sont entraînés avec AdamW.
Pourquoi c'est important : Adam fonctionne bien sur une large gamme de tâches et d'hyperparamètres, ce qui en fait l'optimiseur par défaut. Le comprendre explique pourquoi l'entraînement « fonctionne tout simplement » la plupart du temps (Adam s'adapte par paramètre) et pourquoi parfois ça ne marche pas (les besoins mémoire d'Adam sont 2 fois les paramètres du modèle, ce qui compte pour les grands modèles). C'est aussi la réponse à « quel optimiseur je devrais utiliser? » dans 90 % des cas.
AWS Bedrock
Amazon Bedrock
Compagnies
La plateforme managée d'Amazon Web Services pour accéder et déployer des modèles de fondation de multiples fournisseurs (Anthropic, Meta, Mistral, Cohere, Stability AI, les modèles Titan d'Amazon) via une API unifiée. Bedrock gère l'hébergement, le scaling et le fine-tuning des modèles, permettant aux entreprises d'utiliser l'IA sans gérer l'infrastructure GPU. Il fournit aussi des garde-fous, des bases de connaissances (RAG) et des capacités d'agents.
Pourquoi c'est important : AWS Bedrock est la façon dont la plupart des entreprises Fortune 500 accèdent aux modèles IA. Son approche multi-modèles permet aux entreprises de comparer et basculer entre les fournisseurs (Claude, Llama, Mistral) via une seule API, évitant le verrouillage fournisseur. Pour les entreprises déjà sur AWS (ce qui est le cas de la plupart des grandes entreprises), Bedrock est le chemin de moindre résistance pour l'adoption de l'IA — même compte, même facturation, mêmes cadres de conformité.
Observabilité IA
Monitoring de LLM, AI Tracing, LLMOps
Infrastructure
Surveiller et comprendre le comportement des systèmes IA en production — suivre les entrées, sorties, la latence, les coûts, les erreurs et les métriques de qualité en temps réel. L'observabilité IA est comme le monitoring d'applications (Datadog, New Relic) mais spécialisée pour l'IA : tracer les paires prompt-réponse, détecter la dégradation de qualité, surveiller les hallucinations, et alerter sur les comportements anormaux.
Pourquoi c'est important : Déployer un système IA sans observabilité, c'est comme naviguer à l'aveugle. Tu ne sais pas si le modèle hallucine plus que d'habitude, si la latence augmente, si un type de requête spécifique échoue, ou si les coûts explosent. L'observabilité IA transforme « ça a l'air de marcher » en « on sait que ça marche, et on sait quand ça ne marche pas. » C'est la différence entre une démo et un système de production.
BLEU & ROUGE
Score BLEU, score ROUGE
Fondamentaux
Des métriques classiques pour évaluer la qualité de la génération de texte en comparant la sortie du modèle à des textes de référence. BLEU (Bilingual Evaluation Understudy) mesure combien de n-grammes du texte généré apparaissent dans la référence — conçu à l'origine pour la traduction automatique. ROUGE (Recall-Oriented Understudy for Gisting Evaluation) mesure combien de n-grammes de la référence apparaissent dans le texte généré — conçu pour le résumé automatique.
Pourquoi c'est important : BLEU et ROUGE ont été les métriques d'évaluation standard en NLP pendant plus d'une décennie et sont encore largement utilisés. Les comprendre — et comprendre leurs limites — t'aide à évaluer les claims de recherche en NLP et à comprendre pourquoi le domaine se tourne vers l'évaluation humaine et l'évaluation par modèle. Un score BLEU élevé ne garantit pas la qualité; un score BLEU faible ne garantit pas l'échec.
Bria
Données d'entraînement sous licence, génération d'images entreprise
Compagnies
Entreprise israélienne d'IA qui a construit ses modèles de génération d'images exclusivement à partir de données d'entraînement sous licence et attribuées. Se positionne comme le choix sûr pour les entreprises qui ont besoin de visuels générés par l'IA sans risque de droit d'auteur.
Pourquoi c’est important : Bria est le cas de test le plus en vue pour déterminer si la génération d'images par IA peut reposer sur des données d'entraînement entièrement sous licence tout en restant commercialement compétitive. Dans un secteur confronté à une avalanche de litiges en matière de droits d'auteur, leur approche offre aux entreprises un chemin vers l'adoption de l'IA générative sans exposition juridique — une proposition de valeur qui gagne en pertinence à chaque nouvelle poursuite déposée contre des concurrents. Si Bria réussit, cela valide toute une philosophie de développement responsable de l'IA ; si elle peine, cela suggère que le marché ne se soucie finalement pas assez de la provenance des données pour payer un supplément.
ByteDance
Doubao, TikTok, recommandations propulsées par IA
Compagnies
Société mère de TikTok et l'une des entreprises technologiques les plus valorisées au monde. Leur laboratoire d'IA développe la famille de modèles Doubao et alimente les algorithmes de recommandation qui servent plus d'un milliard d'utilisateurs quotidiennement.
Pourquoi c’est important : ByteDance est l'entreprise technologique privée la plus valorisée au monde et déploie l'IA à une échelle que peu d'organisations peuvent égaler, servant plus d'un milliard d'utilisateurs quotidiennement via TikTok, Douyin et une suite croissante de produits propulsés par l'IA. Leur famille de modèles Doubao et leur plateforme infonuagique Volcano Engine en font un concurrent redoutable dans la course aux modèles fondationnels, soutenus par quelque chose dont la plupart des startups d'IA ne peuvent que rêver : une activité principale massive et rentable, et une distribution intégrée auprès de plus d'un milliard d'utilisateurs.
Black Forest Labs
Modèles FLUX.1
Compagnies
Fondée par les créateurs originaux de Stable Diffusion après leur départ de Stability AI. Leurs modèles FLUX sont rapidement devenus la nouvelle référence en génération d'images open source, surpassant la qualité des modèles qu'ils avaient laissés derrière eux.
Pourquoi c’est important : Black Forest Labs représente le meilleur scénario possible pour l'IA open source : les architectes originaux de Stable Diffusion repartant à zéro avec une meilleure technologie, une stratégie d'affaires plus intelligente et la confiance de la communauté créative. FLUX.1 n'a pas simplement itéré sur Stable Diffusion — il l'a surpassé d'un bond, et le modèle de licence par paliers qu'ils ont inauguré devient le plan directeur pour les entreprises d'IA cherchant à équilibrer ouverture et revenus.
Entraînement
Un test standardisé utilisé pour évaluer et comparer les modèles d'IA. Les benchmarks mesurent des capacités spécifiques — le raisonnement (ARC), les mathématiques (GSM8K), la programmation (HumanEval), les connaissances générales (MMLU) — et produisent des scores comparables entre les modèles.
Pourquoi c’est important : Les benchmarks sont la façon dont l'industrie tient le score, mais ils sont imparfaits. Les modèles peuvent être entraînés pour exceller aux benchmarks sans être réellement meilleurs. La performance en conditions réelles raconte souvent une histoire différente. Considérez-les comme des signaux, pas comme des vérités.
Sécurité
Des schémas systématiques dans les sorties de l'IA qui reflètent ou amplifient les préjugés sociétaux présents dans les données d'entraînement. Les biais peuvent apparaître dans la génération de texte, la création d'images, les outils de recrutement, et partout où les modèles prennent des décisions qui affectent les gens différemment.
Pourquoi c’est important : Si les données d'entraînement disent que les infirmières sont des femmes et les ingénieurs sont des hommes, le modèle perpétuera cela. Les biais ne sont pas toujours évidents — ils se cachent dans les associations de mots, les présupposés par défaut et la représentation des uns et des autres.
BERT
Bidirectional Encoder Representations from Transformers
Un modèle basé sur le Transformer de Google (2018) qui a révolutionné le NLP en introduisant le pré-entraînement bidirectionnel — chaque token peut porter attention à tous les autres tokens, donnant au modèle une compréhension contextuelle profonde. BERT est un modèle encodeur seulement : il excelle à comprendre le texte (classification, recherche, NER) mais ne peut pas générer du texte comme GPT ou Claude.
Pourquoi c'est important : BERT est l'article de NLP le plus influent de l'ère moderne. Il a prouvé que le pré-entraînement sur du texte non étiqueté suivi d'un ajustement fin sur des tâches spécifiques pouvait écraser tous les benchmarks existants. Même si les LLM ont volé la vedette, les modèles de type BERT alimentent encore la plupart des moteurs de recherche, systèmes d'embeddings et pipelines de classification en production parce qu'ils sont plus petits, plus rapides et moins chers que les LLM pour les tâches non génératives.
Taille de lot et époque
Mini-lot, époque d'entraînement
La taille de lot est le nombre d'exemples d'entraînement que le modèle traite avant de mettre à jour ses paramètres. Une époque est un passage complet à travers l'ensemble du jeu de données d'entraînement. Un modèle entraîné pendant 3 époques sur 1 million d'exemples avec une taille de lot de 1 000 traite 1 000 exemples par mise à jour, effectue 1 000 mises à jour par époque, et 3 000 mises à jour au total.
Pourquoi c'est important : La taille de lot et les époques sont les contrôles les plus fondamentaux de l'entraînement. La taille de lot affecte la vitesse d'entraînement, l'utilisation mémoire et même ce que le modèle apprend (les petits lots ajoutent du bruit qui peut aider la généralisation; les gros lots convergent plus vite mais peuvent moins bien généraliser). Le nombre d'époques détermine combien de fois le modèle voit chaque exemple — trop peu et il sous-ajuste, trop et il surajuste.
BPE
Byte Pair Encoding, tokenisation en sous-mots
Fondamentaux
L'algorithme le plus courant pour construire les vocabulaires de tokeniseurs. BPE commence avec des octets ou caractères individuels et fusionne itérativement la paire adjacente la plus fréquente en un nouveau token. Après des milliers de fusions, les mots courants deviennent des tokens uniques ("the", "function") tandis que les mots rares sont découpés en sous-mots ("un" + "common"). Utilisé par GPT, Claude, Llama et la plupart des LLM modernes.
Pourquoi c’est important : BPE est la raison pour laquelle ton tokeniseur fonctionne comme il le fait. Il explique pourquoi les mots courants sont peu coûteux (un seul token), pourquoi les mots rares sont chers (plusieurs tokens), et pourquoi le texte non anglais coûte plus (moins de fusions allouées aux paires de caractères non anglais). Comprendre BPE t'aide à prédire les comptes de tokens, optimiser les prompts et comprendre pourquoi différents tokeniseurs produisent des résultats différents pour le même texte.
Rétropropagation
Backprop, passe arrière
Fondamentaux
L'algorithme qui calcule combien chaque paramètre d'un réseau de neurones a contribué à l'erreur, permettant à la descente de gradient de mettre à jour les paramètres efficacement. La rétropropagation applique la règle de la chaîne du calcul différentiel en sens inverse à travers le réseau : en partant de la perte en sortie, elle propage les gradients en arrière à travers chaque couche pour déterminer la part de responsabilité de chaque poids.
Pourquoi c’est important : La rétropropagation est l'algorithme qui rend l'entraînement des réseaux de neurones possible. Sans un moyen efficace de calculer les gradients pour des milliards de paramètres, la descente de gradient serait computationnellement infaisable. Chaque modèle que tu utilises — d'un petit classifieur à un LLM de 400B — a été entraîné par rétropropagation. C'est l'algorithme le plus important de l'apprentissage profond.
Calcul au moment du test
Calcul à l'inférence, chaîne de pensée, tokens de réflexion
Fondamentaux
Utiliser du calcul supplémentaire pendant l'inférence (quand le modèle génère une réponse) pour améliorer la qualité de la réponse. Au lieu de générer une réponse immédiatement, le modèle « réfléchit » plus longtemps — générant des tokens de raisonnement, explorant plusieurs approches ou vérifiant sa propre sortie. Plus de calcul au moment du test produit de meilleures réponses, surtout pour les tâches de raisonnement complexes.
Pourquoi c'est important : Le calcul au moment du test est le dernier paradigme de mise à l'échelle. La première ère a mis à l'échelle le calcul d'entraînement (modèles plus gros, plus de données). L'ère actuelle met aussi à l'échelle le calcul d'inférence (plus de réflexion par question). Des modèles comme o1 et Claude avec réflexion étendue montrent que laisser un modèle raisonner pendant 30 secondes surpasse souvent un modèle qui répond en 2 secondes, même si le modèle rapide est techniquement plus gros. Ça change l'économie : la qualité devient une fonction de combien tu es prêt à dépenser par requête.
Caractéristique
Représentation apprise, activation
Fondamentaux
Un pattern ou concept qu'un réseau de neurones apprend à détecter dans ses entrées. En vision, les caractéristiques des premières couches sont des bords et des textures; celles des couches profondes sont des parties d'objets et des objets entiers. Dans les modèles de langage, les caractéristiques vont du simple (la lettre « a », un pattern syntaxique spécifique) à l'abstrait (le concept de sarcasme, une stratégie de raisonnement particulière). Les caractéristiques sont représentées comme des patterns d'activation à travers les neurones.
Pourquoi c'est important : Les caractéristiques sont ce que les modèles apprennent vraiment — pas des faits individuels mais des patterns qui généralisent. Un modèle ne mémorise pas « les chats ont de la fourrure »; il apprend un détecteur de texture de fourrure qui s'active pour les chats, les chiens et les oursons en peluche. Comprendre les caractéristiques aide à expliquer le comportement des modèles : pourquoi ils généralisent (les caractéristiques se transfèrent), pourquoi ils échouent (mauvaise caractéristique activée), et comment les améliorer (les exposer à des caractéristiques plus diverses).
Clustering
K-Means, DBSCAN, analyse de clusters
Fondamentaux
Une tâche d'apprentissage non supervisé qui regroupe des points de données similaires sans étiquettes prédéfinies. Avec des données d'achat de clients, le clustering pourrait découvrir des segments de clientèle distincts (chasseurs de bonnes affaires, acheteurs de luxe, acheteurs occasionnels). K-means est l'algorithme le plus courant : choisir K clusters, assigner chaque point au centre de cluster le plus proche, et affiner itérativement les centres.
Pourquoi c'est important : Le clustering est la tâche d'apprentissage non supervisé la plus courante et apparaît partout : segmentation de clientèle, regroupement de documents, détection d'anomalies (valeurs aberrantes qui ne rentrent dans aucun cluster), compression d'images (regroupement de pixels similaires) et exploration de données (quels groupes naturels existent dans mes données?). C'est souvent la première étape pour comprendre un nouveau jeu de données.
Un cadre mathématique qui garantit la confidentialité individuelle dans l'analyse de données agrégées et l'entraînement de modèles. Avec la confidentialité différentielle, ajouter ou retirer les données d'un seul individu change la sortie d'au plus un petit montant borné. Ça signifie qu'on peut apprendre des patterns utiles d'un jeu de données sans révéler d'information sur une personne spécifique qu'il contient.
Pourquoi c'est important : Alors que l'IA s'entraîne sur des données de plus en plus personnelles (dossiers de santé, transactions financières, messages), la confidentialité différentielle fournit la plus forte garantie connue que les données individuelles ne peuvent pas être extraites du modèle. Elle est utilisée par Apple (prédictions au clavier), Google (analytique d'utilisation de Chrome) et le Bureau du recensement américain. Pour l'IA, elle répond à la préoccupation que les LLM puissent mémoriser et reproduire des données d'entraînement privées.
Couche
Couche cachée, couche de réseau de neurones
Fondamentaux
Un groupe de neurones qui traite les données à un niveau d'abstraction spécifique dans un réseau de neurones. La couche d'entrée reçoit les données brutes. Les couches cachées (celles du milieu) apprennent des représentations de plus en plus abstraites. La couche de sortie produit le résultat final. L'apprentissage « profond » signifie beaucoup de couches cachées — les LLM modernes en ont de 32 à 128+.
Pourquoi c'est important : Les couches créent la hiérarchie qui rend l'apprentissage profond puissant. Les premières couches apprennent des patterns simples (des bords dans les images, des fragments de mots dans le texte). Les couches intermédiaires combinent ces patterns en concepts (visages, phrases). Les couches profondes combinent les concepts en compréhension de haut niveau (reconnaissance de scènes, raisonnement). La profondeur d'un réseau détermine la complexité des patterns qu'il peut apprendre.
Vision par ordinateur
Vision artificielle, vision machine
Fondamentaux
Le domaine de l'IA axé sur la capacité des machines à interpréter et comprendre l'information visuelle du monde — images, vidéo, scènes 3D et documents. La vision par ordinateur propulse tout, de la reconnaissance faciale et la conduite autonome à l'imagerie médicale et la génération d'images par IA. Les tâches fondamentales incluent la détection d'objets, la classification d'images, la segmentation, l'OCR et l'estimation de pose.
Pourquoi c’est important : La vision par ordinateur a été le premier domaine où l'apprentissage profond a clairement dépassé la performance humaine (ImageNet 2012), et elle reste l'une des applications commerciales les plus impactantes de l'IA. Chaque image ou vidéo IA que vous générez, chaque document que vous passez en OCR, chaque caméra de sécurité avec détection intelligente — c'est tout de la vision par ordinateur.
Modération de contenu
Modération par IA, Trust & Safety
Sécurité
Utiliser l'IA pour détecter et filtrer le contenu nuisible, illégal ou contraire aux politiques à grande échelle. Cela inclut la classification de texte (discours haineux, pourriel, menaces), l'analyse d'images (détection NSFW, CSAM), et la modération vidéo. Les systèmes modernes combinent des classificateurs IA avec une revue humaine, mais le volume de contenu généré par l'IA elle-même crée une crise de modération — il faut désormais de l'IA pour modérer l'IA.
Pourquoi c’est important : Chaque plateforme avec du contenu généré par les utilisateurs a besoin de modération, et l'IA est le seul moyen de gérer l'échelle. Mais la modération est plus difficile qu'il n'y paraît — le contexte compte, les normes culturelles diffèrent, et les faux positifs réduisent au silence la parole légitime tandis que les faux négatifs laissent passer le préjudice.
Cartesia
Sonic, modèles vocaux basés sur SSM
Compagnies
Entreprise en démarrage spécialisée en voix IA, construite sur une architecture de modèles d'espace d'états (SSM) plutôt que sur des transformers. Leurs modèles Sonic atteignent une latence ultra-faible en génération vocale, rendant l'IA conversationnelle en temps réel véritablement naturelle pour la première fois.
Pourquoi c’est important : Cartesia compte parce qu'elle a prouvé que les modèles d'espace d'états ne sont pas qu'une curiosité de recherche, mais une architecture commercialement viable pour la voix IA en temps réel. Leur latence inférieure à 100 millisecondes rend l'IA conversationnelle véritablement naturelle possible pour la première fois, comblant l'écart entre « parler à un robot » et « parler à une personne ». Alors que l'industrie se tourne vers des agents IA axés sur la voix, l'avantage architectural de Cartesia en matière de vitesse de diffusion en continu pourrait en faire la couche d'infrastructure sur laquelle tous les autres construisent.
Cohere
Command, Embed, Rerank
Compagnies
Entreprise d'IA axée sur les entreprises, cofondée par Aidan Gomez, l'un des coauteurs de l'article fondateur « Attention Is All You Need » sur le Transformer. Spécialisée dans les modèles optimisés pour les cas d'usage professionnels, le RAG et le support multilingue.
Pourquoi c’est important : Cohere représente le cas d'étude le plus clair pour déterminer si une entreprise d'IA ciblée et axée sur les entreprises peut prospérer de manière indépendante à une époque dominée par les hyperscalers à mille milliards de dollars et les laboratoires de pointe tournés vers le grand public. Leur filiation avec l'article sur le Transformer leur confère une véritable crédibilité technique, leur flexibilité de déploiement résout un vrai problème pour les industries réglementées, et leurs modèles de plongement et de reclassement sont devenus des outils incontournables pour les systèmes RAG en production à travers le monde. Si l'avenir de l'IA repose moins sur les agents conversationnels et davantage sur une infrastructure tissée dans chaque flux de travail professionnel, Cohere est positionnée pour avoir une importance considérable.
Utiliser l’AI
Une technique de prompting où l'on demande au modèle de montrer son raisonnement étape par étape avant de donner une réponse finale. Au lieu de sauter à une conclusion, le modèle « réfléchit à voix haute », ce qui améliore considérablement la précision sur les tâches complexes.
Pourquoi c’est important : Demander « expliquez votre raisonnement » n'est pas seulement une question de transparence — cela rend réellement les modèles plus intelligents. La chaîne de pensée a réduit les erreurs mathématiques jusqu'à 50 % dans les premières études. La plupart des modèles modernes le font maintenant de manière interne.
Fenêtre de contexte
Longueur de contexte
Utiliser l’AI
La quantité maximale de texte (mesurée en tokens) qu'un modèle peut traiter dans une seule conversation. Cela inclut à la fois votre entrée et la sortie du modèle. Si un modèle a une fenêtre de contexte de 200 000 tokens, cela représente environ 150 000 mots — soit deux romans.
Pourquoi c’est important : La taille de la fenêtre de contexte détermine ce que vous pouvez faire. Résumer une base de code complète? Il faut un grand contexte. Question-réponse rapide? Un petit suffit. Mais plus grand n'est pas toujours mieux — les modèles peuvent perdre le fil dans les contextes très longs.
Corpus
Jeu de données, données d'entraînement
Entraînement
L'ensemble de textes (ou d'autres données) utilisé pour entraîner un modèle. Un corpus peut aller de collections organisées de livres et d'articles à des collectes massives de l'ensemble d'Internet. La qualité et la composition du corpus déterminent fondamentalement ce que le modèle sait et comment il se comporte.
Pourquoi c’est important : Données de mauvaise qualité, résultats de mauvaise qualité. Un modèle entraîné sur Reddit parle différemment d'un modèle entraîné sur des articles scientifiques. C'est pourquoi nous avons constitué notre propre corpus pour Sarah — les collectes web génériques produisaient des résultats confus et incohérents.
Chatbot
Assistant IA
Interface logicielle pour l'interaction conversationnelle avec l'IA. Les chatbots modernes (Claude, ChatGPT, Gemini) sont alimentés par des LLM et gèrent le dialogue ouvert, le code, les images et les outils.
Pourquoi c'est important : La façon principale dont la plupart des gens interagissent avec l'IA. Le chatbot est un produit construit sur le modèle, pas le modèle lui-même.
Éditeur de code natif IA (fork de VS Code). Intégration LLM profonde : génération inline, édition multi-fichiers, contexte conscient de la base de code.
Pourquoi c'est important : Le pari que l'IA change fondamentalement la façon d'écrire du code. Adoption rapide, gains de productivité tangibles.
Classification
Classifieur, catégorisation
La tâche d'assigner une entrée à l'une d'un ensemble prédéfini de catégories. « Ce courriel est-il du spam ou non? » (classification binaire). « Cette image est-elle un chat, un chien ou un oiseau? » (multi-classe). « Quelles étiquettes s'appliquent à cet article? » (multi-étiquettes). La classification est la tâche d'apprentissage supervisé la plus courante et la base d'innombrables applications réelles de l'IA.
Pourquoi c'est important : La classification est là où la plupart des gens rencontrent l'apprentissage automatique en pratique — filtres anti-spam, modération de contenu, diagnostic médical, détection de fraude, analyse de sentiment. Comprendre la classification t'aide à comprendre tout le pipeline d'apprentissage supervisé : données étiquetées en entrée, modèle entraîné, prédictions en sortie.
CNN
Réseau de neurones convolutif, ConvNet
Une architecture de réseau de neurones conçue pour traiter des données en grille (images, spectrogrammes audio) en faisant glisser de petits filtres (noyaux) sur l'entrée pour détecter des patterns locaux comme les contours, les textures et les formes. Les CNN ont dominé la vision par ordinateur de 2012 (AlexNet) jusqu'à l'émergence des Vision Transformers vers 2020. Ils sont encore largement utilisés en production, surtout sur les appareils en périphérie.
Pourquoi c'est important : Les CNN ont lancé la révolution de l'apprentissage profond. La victoire d'AlexNet sur ImageNet en 2012 a prouvé que les réseaux de neurones profonds pouvaient surpasser de façon spectaculaire les caractéristiques conçues à la main, déclenchant le boom actuel de l'IA. Comprendre les CNN t'aide à comprendre pourquoi les Transformers fonctionnent (beaucoup des mêmes idées — caractéristiques hiérarchiques, partage de paramètres — s'appliquent), et les CNN restent le meilleur choix pour beaucoup de tâches de vision sur des appareils à ressources limitées.
Une technique d'alignement développée par Anthropic où un modèle est entraîné à suivre un ensemble de principes (une « constitution ») plutôt que de dépendre uniquement du feedback humain pour chaque décision. Le modèle critique et révise ses propres sorties en fonction de ces principes, puis est entraîné sur les sorties révisées. Cela réduit le besoin d'annotateurs humains et rend les critères d'alignement explicites et auditables.
Pourquoi c'est important : L'IA constitutionnelle résout deux problèmes du RLHF : c'est coûteux (des annotateurs humains pour chaque exemple d'entraînement) et opaque (les critères sont implicites dans les jugements des annotateurs). En rendant les principes explicites, l'IA constitutionnelle rend l'alignement plus transparent, évolutif et cohérent. C'est une partie centrale de la façon dont Claude est entraîné.
Oubli catastrophique
Interférence catastrophique
Quand un réseau de neurones entraîné sur une nouvelle tâche perd sa capacité à exécuter les tâches précédemment apprises. Ajuster finement un modèle sur des données de service client pourrait le rendre excellent en support mais terrible en programmation. Le nouvel apprentissage écrase les poids qui encodaient les anciennes capacités, les « oubliant ».
Pourquoi c'est important : L'oubli catastrophique est le défi central de l'ajustement fin et de l'apprentissage continu. C'est pourquoi tu ne peux pas simplement continuer à ajuster un modèle sur tâche après tâche en espérant qu'il fasse tout bien. C'est aussi pourquoi des techniques comme LoRA (qui ne modifient qu'un petit sous-ensemble de paramètres) et un choix soigneux du taux d'apprentissage sont critiques pour préserver les capacités du modèle de base.
Contamination
Contamination des données, fuite de benchmarks
Quand les données de test d'un benchmark apparaissent dans les données d'entraînement d'un modèle, gonflant ses scores sans refléter une capacité réelle. Si un modèle a « étudié le corrigé » en voyant les questions de test pendant l'entraînement, sa performance au benchmark est sans signification. La contamination est un problème croissant à mesure que les jeux de données d'entraînement grossissent et récupèrent davantage d'internet, où les données de benchmark sont souvent publiées.
Pourquoi c'est important : La contamination mine tout le système de benchmarks que l'industrie de l'IA utilise pour comparer les modèles. Un modèle qui score 90 % sur MMLU parce qu'il a mémorisé les réponses n'est pas plus intelligent qu'un autre scorant 80 % qui ne les a jamais vues. À mesure que plus de benchmarks fuient dans les données d'entraînement, la communauté est forcée de créer de nouveaux benchmarks constamment, et les évaluations privées avec des données retenues deviennent plus importantes que les classements publics.
Chatbot Arena
LMSYS Arena, classements ELO
Une plateforme participative (par LMSYS) où les utilisateurs discutent avec deux modèles d'IA anonymes côte à côte et votent pour la meilleure réponse. Les résultats sont utilisés pour calculer des scores ELO — le même système de classement utilisé aux échecs — créant un tableau de bord continuellement mis à jour de la qualité des modèles basé sur de vraies préférences humaines plutôt que des benchmarks automatisés.
Pourquoi c'est important : Chatbot Arena est sans doute la comparaison de modèles la plus fiable aujourd'hui parce qu'elle résiste à la contamination (les questions sont originales), reflète de vraies préférences utilisateurs (pas des benchmarks synthétiques), et met les modèles face à face (la comparaison relative est plus fiable que les scores absolus). Quand les gens disent « Claude est meilleur que GPT pour le code » ou vice versa, les classements Arena sont souvent la preuve citée.
Cerebras
Cerebras Systems, WSE
Une entreprise de puces qui construit des processeurs d'IA à l'échelle du wafer — des puces de la taille d'un wafer de silicium entier, plus de 100x plus grandes qu'un GPU standard. Le Cerebras WSE-3 (Wafer Scale Engine) contient 4 trillions de transistors et 900 000 cœurs. Leurs systèmes CS-3 sont conçus tant pour l'entraînement que l'inférence, offrant une alternative aux clusters de milliers de GPU individuels.
Pourquoi c'est important : Cerebras représente la refonte la plus radicale du matériel d'IA. Au lieu de connecter des milliers de petites puces avec une bande passante limitée, ils mettent tout sur une seule puce massive avec une bande passante mémoire sur puce énorme. L'avantage potentiel est d'éliminer le goulot d'étranglement de communication qui limite l'entraînement multi-GPU. La question à un milliard de dollars est de savoir si le calcul à l'échelle du wafer peut concurrencer l'écosystème massif de NVIDIA.
Attention croisée
Attention encodeur-décodeur
Fondamentaux
Un mécanisme d'attention où les requêtes (queries) proviennent d'une séquence et les clés/valeurs d'une autre séquence. Dans les modèles encodeur-décodeur, les requêtes du décodeur assistent aux clés et valeurs de l'encodeur, permettant au décodeur de « regarder » l'entrée pendant qu'il génère la sortie. L'attention croisée est aussi la façon dont le texte conditionne la génération d'images dans les modèles de diffusion — le processus de génération d'image assiste au prompt textuel.
Pourquoi c’est important : L'attention croisée est le pont entre différentes modalités et différentes parties d'une architecture. C'est ainsi que les modèles de traduction connectent les langues source et cible, que les générateurs d'images suivent les prompts textuels, que les modèles multimodaux relient images et texte, et que les systèmes RAG incorporent les documents récupérés. Chaque fois que deux entrées différentes doivent interagir, l'attention croisée est généralement impliquée.
Extension de longueur de contexte
YaRN, NTK Scaling, mise à l'échelle RoPE
Infrastructure
Des techniques qui permettent aux modèles de langage de gérer des séquences plus longues que celles vues pendant l'entraînement. Un modèle entraîné sur 4K tokens peut être étendu à 32K ou 128K par des modifications de son encodage positionnel (typiquement RoPE) combinées à un court ajustement fin sur des séquences plus longues. Cela évite le coût énorme d'entraîner un modèle de zéro sur de longues séquences.
Pourquoi c’est important : L'extension de longueur de contexte est la raison pour laquelle les modèles sont passés de 4K à 128K à 1M+ de tokens de contexte en seulement deux ans. Le coût d'entraîner un modèle de zéro sur des séquences d'un million de tokens serait prohibitif. Les techniques d'extension rendent les modèles à long contexte pratiques en adaptant des modèles entraînés sur des séquences plus courtes, nécessitant seulement une fraction du calcul d'entraînement original.
Similarité cosinus
Distance cosinus, similarité vectorielle
Fondamentaux
Une mesure de similarité entre deux vecteurs basée sur l'angle entre eux, ignorant leur magnitude. Une similarité cosinus de 1 signifie que les vecteurs pointent dans la même direction (sens identique). 0 signifie qu'ils sont perpendiculaires (sans rapport). -1 signifie des directions opposées. C'est la métrique de similarité standard pour comparer des embeddings textuels dans la recherche sémantique, le RAG et les systèmes de recommandation.
Pourquoi c’est important : Chaque fois que tu fais de la recherche sémantique, utilises du RAG ou compares des embeddings, la similarité cosinus est (probablement) la métrique qui décide ce qui est "similaire". La comprendre t'aide à déboguer la qualité de la récupération, choisir entre cosinus et alternatives (produit scalaire, distance euclidienne), et comprendre pourquoi certaines recherches ratent des correspondances évidentes.
CLIP
Contrastive Language-Image Pre-training
Modèles
Un modèle d'OpenAI (2021) qui apprend à connecter images et texte en s'entraînant sur 400 millions de paires image-légende. CLIP encode les images et le texte dans le même espace d'embedding, où les paires image-texte correspondantes sont proches et les paires non correspondantes sont éloignées. C'est le pont entre le langage et la vision dans la plupart des systèmes d'IA multimodaux modernes.
Pourquoi c’est important : CLIP est l'épine dorsale de la génération texte-vers-image (Stable Diffusion, DALL-E), de la recherche d'images, de la classification d'images zero-shot et de la compréhension multimodale. Quand tu tapes un prompt et obtiens une image, CLIP (ou un descendant) est ce qui connecte tes mots aux concepts visuels. Il a prouvé qu'on peut apprendre des représentations visuelles puissantes à partir de la supervision par le langage naturel seul, sans jeux de données d'images étiquetées.
Modèles
Une architecture qui ajoute un contrôle spatial aux modèles de génération d'images. Au lieu de simplement décrire ce que tu veux en texte ("une personne debout"), ControlNet te permet de spécifier comment — en fournissant une carte de contours, une carte de profondeur, un squelette de pose ou une carte de segmentation qui guide la composition. L'image générée suit la structure spatiale de ton entrée de contrôle tout en remplissant les détails à partir du prompt textuel.
Pourquoi c’est important : ControlNet a rendu la génération d'images par IA utilisable pour les workflows professionnels. Sans lui, tu obtiens des compositions aléatoires et tu espères le meilleur. Avec lui, tu spécifies la pose, la disposition ou la structure exacte dont tu as besoin. C'est la différence entre "génère quelque chose qui ressemble vaguement à ce que je veux" et "génère exactement cette composition avec ces détails" — crucial pour le design, la publicité et le travail de production.
Checkpoint
Point de contrôle, instantané de modèle
Entraînement
Un instantané sauvegardé de l'état d'un modèle pendant l'entraînement — les poids, l'état de l'optimiseur, le planning du taux d'apprentissage et l'étape d'entraînement. Les checkpoints permettent de reprendre l'entraînement après des interruptions (panne matérielle, préemption), d'évaluer des versions intermédiaires du modèle et de revenir à une version antérieure si l'entraînement se dégrade. Sauvegarder des checkpoints toutes les quelques milliers d'étapes est la pratique standard.
Pourquoi c’est important : Entraîner de grands modèles prend des jours à des mois. Sans checkpoints, une panne GPU à l'étape 90 000 d'un entraînement de 100 000 étapes signifie recommencer à zéro. Les checkpoints sont une assurance : ils sauvegardent la progression de manière incrémentale pour ne perdre que le travail depuis le dernier checkpoint. Ils permettent aussi la sélection de modèle — parfois un checkpoint antérieur performe mieux sur tes métriques d'évaluation que le modèle final.
Connexion résiduelle
Skip connection, connexion de raccourci
Fondamentaux
Une connexion qui contourne une ou plusieurs couches en ajoutant directement l'entrée à la sortie : output = layer(x) + x. Au lieu que chaque couche apprenne une transformation complète, elle n'a qu'à apprendre le "résidu" — la différence par rapport à la fonction identité. Les connexions résiduelles sont présentes dans chaque couche de Transformer et sont essentielles pour entraîner des réseaux profonds.
Pourquoi c'est important : Sans connexions résiduelles, les réseaux profonds sont quasi impossibles à entraîner — les gradients s'évanouissent ou explosent à travers de nombreuses couches. Les connexions résiduelles fournissent une autoroute de gradients qui permet à l'information (et aux gradients) de circuler directement des couches initiales aux couches finales, en contournant n'importe quel nombre de transformations intermédiaires. C'est grâce à elles qu'on peut entraîner des réseaux de 100+ couches.
Couche d'embedding
Token Embedding, table d'embedding, table de correspondance
Fondamentaux
Une table de correspondance qui associe chaque token du vocabulaire à un vecteur dense (l'embedding du token). Quand le modèle reçoit le token ID 42, la couche d'embedding retourne la ligne 42 d'une matrice apprise. Ce vecteur est la représentation initiale du modèle pour ce token — le point de départ de tout le traitement ultérieur à travers les couches d'attention et feedforward.
Pourquoi c'est important : La couche d'embedding est l'endroit où le texte devient des maths. Chaque LLM commence par convertir des tokens discrets (mots, sous-mots) en vecteurs continus que le réseau de neurones peut traiter. La table d'embedding est aussi l'un des plus gros composants des petits modèles — un vocabulaire de 128K avec des embeddings de 4096 dimensions, c'est 512 millions de paramètres. Comprendre cela t'aide à raisonner sur les tailles de modèles et la conception du vocabulaire.
Convolution
Conv, Couche convolutive, Noyau, Filtre
Fondamentaux
Une opération mathématique qui fait glisser un petit filtre (noyau) sur une entrée pour détecter des patterns locaux. Dans les images, un noyau 3×3 glisse sur chaque position, calculant un produit scalaire avec les pixels sous-jacents pour produire une carte de caractéristiques. Différents noyaux détectent différents patterns : bords horizontaux, bords verticaux, textures, et finalement des caractéristiques complexes comme des yeux ou des roues dans les couches plus profondes.
Pourquoi c'est important : La convolution est l'opération qui a fait fonctionner la vision par ordinateur. Elle encode deux hypothèses puissantes : la localité (les pixels voisins sont liés) et l'équivariance par translation (un pattern est le même quel que soit l'endroit où il apparaît). Ces hypothèses réduisent dramatiquement le nombre de paramètres par rapport aux couches entièrement connectées, rendant faisable le traitement d'images haute résolution. Même à l'ère des Transformers, les convolutions sont utilisées dans beaucoup d'architectures hybrides.
Compagnies
Une plateforme pour créer et discuter avec des personnages IA — des personnalités fictives, des figures historiques et des personas personnalisés qui maintiennent une personnalité, des connaissances et des patterns de parole cohérents à travers les conversations. Fondée par d'anciens chercheurs de Google Brain, Character.AI a été l'un des premiers produits IA à atteindre une adoption massive par les consommateurs, avec des millions d'utilisateurs quotidiens, principalement des démographies plus jeunes.
Pourquoi c'est important : Character.AI a prouvé que l'IA sociale/divertissement pouvait générer un engagement massif — les utilisateurs passent plus de temps sur Character.AI que sur beaucoup de plateformes de réseaux sociaux. Elle a été pionnière dans la catégorie « compagnon IA » et a démontré que la cohérence de personnalité, l'engagement émotionnel et la capacité de jeu de rôle sont aussi commercialement importants que la précision factuelle. Google a investi 2,7 G$ dans l'entreprise en 2024.
Compagnies
Un fournisseur de cloud spécialisé entièrement construit autour du calcul GPU pour les charges de travail IA. CoreWeave exploite de grands clusters de GPU NVIDIA (H100, H200) et a sécurisé des milliards en financement et en dette pour construire des centres de données GPU. De grandes entreprises IA (y compris Microsoft et plusieurs labos IA) utilisent CoreWeave pour l'entraînement et l'inférence à grande échelle.
Pourquoi c'est important : CoreWeave est l'une des entreprises d'infrastructure à la croissance la plus rapide en IA, pariant que les fournisseurs de cloud GPU spécialisés peuvent surpasser les hyperscalers généralistes pour les charges de travail IA. Leur spécialisation permet une utilisation plus efficace des GPU, un réseau conçu spécifiquement (InfiniBand pour les clusters d'entraînement), et des prix qui sous-cotent AWS/GCP de 30 à 50 % pour le travail intensif en GPU.
D
Double usage
Technologie à double usage
Sécurité
Une technologie qui peut être utilisée à des fins aussi bien bénéfiques que nuisibles. L'IA est intrinsèquement à double usage : le même modèle qui aide un médecin à diagnostiquer des maladies pourrait aider un acteur malveillant à synthétiser des composés dangereux. Le même modèle de génération de code qui accélère le développement logiciel pourrait aider à créer des logiciels malveillants. Gérer le risque du double usage est un défi central de la gouvernance de l'IA.
Pourquoi c'est important : Le double usage est la tension fondamentale du développement de l'IA. Rendre les modèles plus capables les rend inévitablement plus capables de nuire. Tu ne peux pas construire un moteur de raisonnement puissant qui ne raisonne que sur les bonnes choses. Cette tension alimente les débats sur les sorties open source, les restrictions d'API et la réglementation — comment maximiser les bénéfices tout en minimisant les dommages quand la même capacité permet les deux?
Fondamentaux
Un sous-ensemble de l'apprentissage automatique qui utilise des réseaux de neurones comportant de nombreuses couches (d'où le terme « profond ») pour apprendre des représentations hiérarchiques des données. Chaque couche transforme son entrée en quelque chose légèrement plus abstrait — des pixels aux bords, aux formes, aux objets, jusqu'aux concepts. L'apprentissage profond est ce qui a rendu possible la révolution actuelle de l'intelligence artificielle : c'est l'approche utilisée par les LLM, les générateurs d'images, la reconnaissance vocale et presque toutes les percées en intelligence artificielle depuis 2012.
Pourquoi c’est important : L'apprentissage profond est le moteur de l'ère actuelle de l'intelligence artificielle. Avant 2012, l'IA était une mosaïque d'algorithmes spécialisés. L'apprentissage profond a unifié tout sous un seul paradigme : empiler suffisamment de couches, alimenter en suffisamment de données, appliquer suffisamment de puissance de calcul, et le modèle s'occupe du reste. Comprendre l'apprentissage profond, c'est comprendre pourquoi l'IA fonctionne soudainement.
Outils pour développeurs
SDK IA, frameworks IA
Outils
L'écosystème de bibliothèques, de cadres et de plateformes qui facilitent la construction d'applications propulsées par l'IA. Cela inclut les cadres d'orchestration (LangChain, LlamaIndex), les serveurs d'inférence (vLLM, llama.cpp), les outils d'affinage (Axolotl, Unsloth), les cadres d'évaluation (LMSYS, Braintrust) et les plateformes complètes (Vercel AI SDK, Hugging Face). Le paysage des outils change chaque mois.
Pourquoi c’est important : Les API de modèles bruts sont nécessaires mais pas suffisantes. Les outils de développement comblent l'écart entre « j'ai une clé API » et « j'ai une application en production ». Les bons outils peuvent réduire le temps de développement de mois à jours, tandis que les mauvais ajoutent de la complexité sans valeur.
Deepfakes
Médias synthétiques, hypertrucages
Sécurité
Des images, vidéos ou fichiers audio générés par IA conçus pour montrer de manière convaincante de vraies personnes disant ou faisant des choses qu'elles n'ont jamais faites. Construits à l'origine sur la technologie GAN, les hypertrucages modernes utilisent des modèles de diffusion et le clonage vocal pour produire des résultats de plus en plus difficiles à distinguer de la réalité. Des outils de détection existent mais sont systématiquement en retard sur les capacités de génération.
Pourquoi c’est important : Les hypertrucages sont le côté sombre du pouvoir créatif de l'IA générative. Ils ont été utilisés pour la fraude, l'imagerie intime non consentie, la manipulation politique et le vol d'identité. La technologie est maintenant assez accessible pour que n'importe qui avec un portable puisse créer des faux convaincants, rendant la détection, le filigranage et les cadres juridiques des priorités urgentes.
Centres de données
Centres de données IA, grappes de GPU
Infrastructure
Les installations physiques qui abritent les serveurs, les GPU, les équipements réseau et les systèmes de refroidissement nécessaires pour entraîner et faire tourner les modèles d'IA. Les centres de données modernes pour l'IA sont construits sur mesure pour le calcul parallèle massif, consommant des mégawatts d'électricité et nécessitant un refroidissement spécialisé. Un seul entraînement de modèle de pointe peut occuper des milliers de GPU dans une installation entière pendant des mois.
Pourquoi c’est important : Les centres de données sont les usines de l'ère de l'IA. Chaque requête à Claude, chaque image de Midjourney, chaque vidéo de Runway tourne sur du matériel installé dans un de ces bâtiments. La pénurie mondiale de capacité de centres de données prêts pour l'IA est l'une des plus grandes contraintes sur la croissance de l'IA — et l'une des plus grandes opportunités d'investissement.
DeepL
Traduction automatique neuronale, DeepL Pro
Compagnies
Entreprise allemande d'IA largement considérée comme le meilleur service de traduction automatique au monde. Construite par une équipe de linguistes computationnels qui surpasse constamment Google Translate et les autres offres des géants technologiques, particulièrement pour les langues européennes.
Pourquoi c’est important : DeepL est la preuve vivante qu'une entreprise d'IA spécialisée peut constamment surpasser des concurrents valant des milliers de milliards de dollars sur une compétence fondamentale. Dans un domaine où plus gros signifie habituellement meilleur, l'avantage de DeepL en qualité de traduction par rapport à Google et Microsoft demeure mesurable et significatif, surtout pour les langues européennes et les cas d'utilisation professionnels. Leur succès remet en question l'hypothèse selon laquelle les modèles d'IA polyvalents finiront inévitablement par banaliser les tâches spécialisées — et pour les centaines de milliers d'entreprises qui dépendent d'une communication multilingue précise, cette spécialisation vaut la peine d'être payée.
Decart AI
Simulation de monde en temps réel, génération de jeux
Compagnies
Entreprise israélienne d'IA qui repousse les limites de la génération IA en temps réel. Leur technologie peut générer des environnements interactifs similaires à des jeux vidéo en temps réel, brouillant la frontière entre le rendu traditionnel et la génération par IA.
Pourquoi c’est important : Decart AI a démontré quelque chose que la plupart des gens pensaient être encore à des années de distance : un réseau de neurones générant un monde 3D interactif et jouable en temps réel, sans aucun moteur de jeu traditionnel impliqué. Leur démonstration Oasis était une preuve de concept pour la simulation de monde native de l'IA, une technologie aux implications bien au-delà du jeu vidéo — de la conduite autonome à la robotique en passant par l'informatique spatiale. Si les modèles du monde en temps réel deviennent viables à un niveau de qualité production, les travaux pionniers de Decart en optimisation d'inférence et en génération interactive auront été fondateurs.
DeepSeek
DeepSeek-V3, DeepSeek-R1
Compagnies
Laboratoire d'IA chinois qui a secoué l'industrie début 2025 avec DeepSeek-R1, un modèle de raisonnement rivalisant avec les laboratoires de pointe pour une fraction du coût d'entraînement. Soutenu par le fonds spéculatif quantitatif High-Flyer.
Pourquoi c’est important : DeepSeek a fait voler en éclats l'hypothèse selon laquelle l'IA de pointe nécessitait des budgets de pointe. Leur approche centrée sur l'efficacité — atteignant des performances de classe GPT-4 et o1 pour une fraction du coût d'entraînement — a forcé l'ensemble de l'industrie à repenser le narratif selon lequel la mise à l'échelle est la seule voie, et à se recentrer sur l'innovation architecturale. La publication en poids ouverts de R1 sous licence MIT a démocratisé l'accès aux modèles de raisonnement d'une manière qu'aucun laboratoire occidental n'avait faite. Et sur le plan géopolitique, DeepSeek a prouvé que les contrôles à l'exportation seuls ne peuvent contenir les capacités en IA, une prise de conscience aux implications profondes pour les politiques technologiques, l'investissement et l'équilibre mondial des forces en IA.
Deepgram
Nova reconnaissance vocale, Aura synthèse vocale
Compagnies
Entreprise d'IA vocale qui construit des API rapides et précises de reconnaissance vocale et de synthèse vocale. Leurs modèles Nova rivalisent avec et surpassent souvent Whisper d'OpenAI en précision tout en fonctionnant nettement plus vite pour les applications en temps réel.
Pourquoi c’est important : Deepgram a prouvé qu'une startup pouvait construire la reconnaissance vocale de zéro en utilisant l'apprentissage profond de bout en bout et rivaliser directement avec Google, Amazon et Microsoft en précision tout en les surpassant en vitesse. Leur approche API axée sur les développeurs a apporté les modèles d'infrastructure modernes à l'IA vocale, rendant l'ajout de transcription à une application aussi simple que l'ajout de paiements avec Stripe. Alors que les agents d'IA conversationnelle deviennent courants, Deepgram se positionne comme la couche d'infrastructure vocale critique en dessous — la plomberie qui fait réellement fonctionner l'IA vocale en production.
Un type de modèle génératif qui crée des images (ou de la vidéo, de l'audio) en partant de bruit pur et en le retirant graduellement jusqu'à ce qu'une sortie cohérente apparaisse. Le modèle apprend à inverser le processus d'ajout de bruit à des données réelles. Stable Diffusion, DALL-E 3 et Midjourney utilisent tous des variantes de cette approche.
Pourquoi c’est important : Les modèles de diffusion ont détrôné les GAN comme technique dominante de génération d'images vers 2022. Ils produisent des sorties plus diversifiées et contrôlables et sont le moteur de presque tous les outils d'IA pour l'image et la vidéo aujourd'hui.
Distillation
Distillation de connaissances
Entraîner un modèle « élève » plus petit à imiter un modèle « professeur » plus grand en apprenant à partir des distributions de probabilité souples du professeur plutôt que des labels bruts.
Pourquoi c'est important : La distillation rend l'IA puissante accessible. Une distillation 70B→7B peut capturer 90% des capacités à 10% du coût.
DPO
Direct Preference Optimization
Une alternative au RLHF pour l'alignement. Le DPO optimise directement le modèle en utilisant des paires de réponses préférées/rejetées, sans modèle de récompense séparé ni RL. Plus simple, plus stable, moins de calcul.
Pourquoi c'est important : Le DPO a démocratisé l'alignement. Le pipeline multi-étapes du RLHF est capricieux; le DPO le ramène à une seule étape.
Jeu de données
Ensemble d'entraînement, données
Une collection structurée de données utilisée pour entraîner, évaluer ou tester un modèle d'apprentissage automatique. Les jeux de données peuvent être étiquetés (chaque exemple a une réponse correcte connue) ou non étiquetés (données brutes sans annotations). La qualité, la taille, la diversité et la représentativité d'un jeu de données déterminent fondamentalement ce qu'un modèle peut apprendre.
Pourquoi c'est important : Poubelle en entrée, poubelle en sortie. L'architecture la plus élégante entraînée sur un mauvais jeu de données produira de mauvais résultats. Inversement, un modèle simple entraîné sur d'excellentes données surpasse souvent un modèle complexe entraîné sur du bruit. La curation des données est sans doute la partie la plus impactante et la moins glamour du développement en IA.
Dropout
Régularisation, décroissance des poids
Une technique de régularisation qui « éteint » aléatoirement une fraction des neurones pendant chaque étape d'entraînement en mettant leurs sorties à zéro. Cela empêche le réseau de trop dépendre d'un seul neurone, le forçant à apprendre des représentations distribuées et robustes. À l'inférence, tous les neurones sont actifs mais mis à l'échelle en conséquence.
Pourquoi c'est important : Le dropout est la défense la plus simple et la plus utilisée contre le surajustement. Sans régularisation, les grands réseaux de neurones mémorisent les données d'entraînement au lieu d'apprendre des patterns généralisables. Le dropout (et son cousin la décroissance des poids) expliquent pourquoi les modèles peuvent être beaucoup plus grands que leurs ensembles d'entraînement sans tout mémoriser.
Une architecture qui remplace le backbone U-Net traditionnellement utilisé dans les modèles de diffusion par un Transformer. Le DiT applique le mécanisme d'attention à la génération d'images, permettant le même comportement de mise à l'échelle qui a rendu les LLM si puissants. Sora, Flux, Stable Diffusion 3 et la plupart des générateurs d'images et de vidéos de pointe utilisent DiT ou des variantes.
Pourquoi c'est important : DiT a unifié les mondes de la génération de langage et d'images sous un seul paradigme architectural : le Transformer. Cela signifie que les lois d'échelle, les techniques d'entraînement et les stratégies d'optimisation développées pour les LLM se transfèrent largement à la génération d'images et de vidéos. C'est pourquoi la qualité d'image a progressé si rapidement — le domaine surfe la même courbe de mise à l'échelle que le langage.
Des techniques qui élargissent artificiellement un jeu de données d'entraînement en créant des versions modifiées des exemples existants. Pour les images : retournement, rotation, recadrage, modification des couleurs. Pour le texte : paraphrase, traduction aller-retour, substitution de synonymes. Pour l'audio : changement de vitesse, injection de bruit. L'objectif est d'enseigner au modèle les invariances — un chat est un chat que l'image soit retournée, assombrie ou recadrée.
Pourquoi c'est important : L'augmentation de données est le moyen le moins cher d'améliorer la performance d'un modèle quand tu as des données limitées. Elle réduit le surajustement en montrant au modèle de nombreuses variations de chaque exemple, lui apprenant à se concentrer sur les caractéristiques essentielles plutôt que les détails superficiels. En vision par ordinateur, l'augmentation fournit couramment 2–5 % d'amélioration d'exactitude gratuitement.
Entraînement distribué
Aussi appelé : Parallélisme de données, parallélisme de modèle, FSDP
Infrastructure
Entraîner un modèle sur plusieurs GPU ou machines simultanément. Le parallélisme de données donne à chaque GPU une copie du modèle et divise les données d'entraînement. Le parallélisme de modèle divise le modèle lui-même entre les GPU quand il est trop gros pour un seul. Les approches modernes comme FSDP (Fully Sharded Data Parallel) et DeepSpeed combinent les deux, permettant l'entraînement de modèles avec des centaines de milliards de paramètres.
Pourquoi c’est important : Aucun modèle de frontière ne tient sur un seul GPU. Entraîner GPT-4 ou Claude nécessite des milliers de GPU travaillant ensemble pendant des mois. L'entraînement distribué est l'ingénierie qui rend ça possible — c'est aussi critique que l'architecture ou les données. L'efficacité de ton entraînement distribué détermine directement la taille du modèle que tu peux entraîner pour un budget donné.
DALL-E
DALL-E 2, DALL-E 3
Modèles
La famille de modèles de génération d'images d'OpenAI. DALL-E 1 (2021) utilisait une approche VAE discrète + Transformer. DALL-E 2 (2022) utilisait CLIP + diffusion. DALL-E 3 (2023) est intégré à ChatGPT et met l'accent sur le suivi des prompts — il utilise un LLM pour réécrire les prompts utilisateur en descriptions d'images détaillées avant la génération, améliorant significativement la correspondance entre ce que tu demandes et ce que tu obtiens.
Pourquoi c'est important : DALL-E est le modèle qui a fait prendre conscience au public de la génération d'images par IA. Le lancement de DALL-E 2 en 2022 est devenu viral et a suscité à la fois l'enthousiasme et l'inquiétude à propos de l'imagerie générée par IA. L'intégration de DALL-E 3 avec ChatGPT a rendu la génération d'images accessible à des centaines de millions d'utilisateurs. Son innovation de réécriture de prompts a influencé la façon dont les autres modèles gèrent la conversion texte-image.
Databricks
Mosaic ML, DBRX, Unity Catalog
Compagnies
Une plateforme de données et d'IA qui fournit des capacités unifiées d'analytique, d'ingénierie de données et de machine learning. Databricks a acquis Mosaic ML (2023) pour ajouter des capacités d'entraînement de LLM et a lancé DBRX, leur propre LLM à poids ouverts. La plateforme est construite sur Apache Spark et fournit une infrastructure managée pour le cycle de vie ML complet, de la préparation des données au serving de modèles.
Pourquoi c'est important : Databricks est l'endroit où les données d'entreprise rencontrent l'IA. La plupart des ambitions IA des entreprises commencent par « on a besoin de donner du sens à nos données », et Databricks est souvent la plateforme qui gère l'ingénierie de données, l'ingénierie de features, l'entraînement de modèles et le serving au même endroit. Leur acquisition de Mosaic ML (connu pour l'entraînement efficace de LLM) a signalé que la plateforme de données et la plateforme IA convergent.
Décodeur
Réseau décodeur, Générateur
Fondamentaux
Un composant de réseau de neurones qui génère une sortie à partir d'une représentation. Dans les Transformers, le décodeur utilise l'attention causale (gauche-à-droite) pour générer des tokens un à la fois. Dans la génération d'images, le décodeur VAE convertit les représentations latentes en images. Dans les auto-encodeurs, le décodeur reconstruit l'entrée originale à partir du goulot d'étranglement compressé. Les décodeurs sont la moitié « génération » de nombreuses architectures.
Pourquoi c'est important : Chaque système d'IA générative a un décodeur en son cœur. GPT, Claude et Llama sont des Transformers décodeur seul. Stable Diffusion utilise un décodeur VAE pour produire des images. Comprendre les décodeurs explique pourquoi la génération est séquentielle (chaque token dépend des tokens précédents), pourquoi la sortie est plus lente que le traitement de l'entrée, et pourquoi le paradigme autorégressif domine la génération de texte.
Détection de langue
Identification de langue, LangID
Utiliser l'AI
Identifier automatiquement dans quelle langue un texte est écrit. « Bonjour le monde » → français. « こんにちは世界 » → japonais. Les modèles modernes peuvent distinguer 100+ langues à partir de seulement quelques mots, gérer du texte multilingue (alternance codique), et identifier des langues très proches (norvégien vs danois, malais vs indonésien).
Pourquoi c'est important : La détection de langue est l'étape initiale essentielle dans tout pipeline multilingue : tu dois savoir dans quelle langue est l'entrée avant de pouvoir la traduire, la diriger vers le bon modèle, ou appliquer un traitement spécifique à la langue. C'est utilisé dans les moteurs de recherche, le routage du support client, la modération de contenu, et tout système qui gère du texte d'utilisateurs du monde entier.
Détection de dérive
Dérive de données, dérive de modèle, dérive de concept
Infrastructure
Surveiller les changements dans la distribution des données ou le comportement du modèle au fil du temps qui pourraient dégrader la performance. Dérive de données : les données d'entrée changent (la démographie des clients évolue, de nouvelles catégories de produits apparaissent). Dérive de concept : la relation entre les entrées et les sorties correctes change (ce qui constitue du spam évolue). Dérive de modèle : les prédictions du modèle deviennent graduellement moins précises même si le modèle lui-même n'a pas changé.
Pourquoi c'est important : Les modèles sont entraînés sur des données historiques, mais le monde continue de changer. Un modèle de détection de fraude entraîné en 2024 manquera les nouveaux patterns de fraude de 2025. Un système de recommandation entraîné sur des comportements pré-pandémie fera de mauvaises suggestions post-pandémie. La détection de dérive attrape ces dégradations avant qu'elles deviennent coûteuses — t'alertant que le modèle a besoin d'être réentraîné ou mis à jour.
Diarisation du locuteur
Qui a parlé quand
Utiliser l'AI
Déterminer qui a parlé quand dans un enregistrement audio avec plusieurs locuteurs. À partir d'un enregistrement de réunion, la diarisation le segmente en « Locuteur A : 0:00–0:15, Locuteur B : 0:15–0:32, Locuteur A : 0:32–0:45. » Combinée avec la reconnaissance vocale, ça produit des transcriptions attribuées par locuteur — essentiel pour les procès-verbaux de réunions, la transcription d'entrevues et l'analytique des centres d'appels.
Pourquoi c'est important : La reconnaissance vocale seule produit un mur de texte sans indication de qui a dit quoi. La diarisation ajoute la structure qui rend les transcriptions utiles : tu peux chercher ce qu'une personne spécifique a dit, résumer les contributions de chaque locuteur, et analyser la dynamique conversationnelle (qui parle le plus, qui interrompt). C'est essentiel pour toute application audio multi-locuteurs.
E
Élagage
Élagage de modèle, élagage de poids
Entraînement
Retirer les paramètres inutiles (poids, neurones ou couches entières) d'un modèle entraîné pour le rendre plus petit et plus rapide sans perte significative de qualité. Comme tailler un arbre : coupe les branches qui contribuent le moins et l'arbre reste en bonne santé. L'élagage structuré retire des neurones entiers ou des têtes d'attention. L'élagage non structuré met à zéro des poids individuels.
Pourquoi c'est important : L'élagage est une technique de compression de modèle aux côtés de la quantification et de la distillation. L'intuition clé : la plupart des réseaux de neurones sont surparamétrés — beaucoup de poids contribuent peu à la sortie. L'hypothèse du « ticket de loterie » suggère qu'au sein d'un grand réseau, il existe un sous-réseau beaucoup plus petit capable d'égaler les performances de l'original. L'élagage trouve et conserve ce sous-réseau.
Évaluation humaine
Human Eval, évaluation manuelle
Fondamentaux
Évaluer la qualité de la sortie de l'IA en faisant juger directement par des humains. Les humains évaluent la fluidité, la précision, l'utilité, la sécurité, et si la sortie répond vraiment à la demande. Malgré son coût et sa lenteur, l'évaluation humaine reste l'étalon-or parce que les métriques automatisées passent souvent à côté de ce qui compte vraiment pour les utilisateurs.
Pourquoi c'est important : Chaque métrique automatisée est un proxy du jugement humain, et chaque proxy a ses angles morts. BLEU ne détecte pas les erreurs factuelles. La perplexité ne mesure pas l'utilité. Même les approches LLM-comme-juge héritent de biais (préférer les réponses verbeuses, par exemple). Quand les enjeux sont élevés — lancer un produit, comparer des versions de modèles, évaluer la sécurité — l'évaluation humaine est irremplaçable.
Émergence
Capacités émergentes, comportement émergent
Fondamentaux
Les capacités qui apparaissent dans les modèles d'intelligence artificielle à grande échelle mais n'ont pas été explicitement entraînées pour — des capacités qui semblent « émerger » soudainement une fois qu'un modèle atteint une certaine taille ou un seuil d'entraînement. Un modèle entraîné uniquement à prédire le mot suivant apprend de manière inattendue à faire des calculs, à traduire entre des langues qu'on ne lui avait pas apprises, ou à écrire du code fonctionnel. L'émergence est l'un des phénomènes les plus débattus en intelligence artificielle : s'agit-il d'une véritable magie de transition de phase, ou d'un artefact de mesure?
Pourquoi c’est important : L'émergence est au cœur de la plus grande question en IA : pouvons-nous prévoir ce que les modèles plus grands seront capables de faire? Si les capacités émergent véritablement de manière imprévisible à grande échelle, alors chaque modèle plus grand est une boîte à surprises. Si l'émergence est un artefact de la manière dont nous mesurons, alors le passage à l'échelle est plus prévisible qu'il n'y paraît. La réponse façonne tout, de la planification de la sécurité aux décisions d'investissement.
Évaluation
Evals, évaluation de modèle
Entraînement
Les méthodes utilisées pour mesurer la performance d'un modèle d'IA. Cela va bien au-delà des bancs d'essai — cela inclut l'évaluation humaine (demander à des personnes de noter les sorties), les tests A/B (comparer des modèles sur du trafic réel), le red-teaming (tests adverses), les tests spécifiques à un domaine (précision médicale, correction du code) et les classements communautaires (Chatbot Arena, LMSYS). Une bonne évaluation est plus difficile que la construction du modèle.
Pourquoi c’est important : Si vous ne pouvez pas le mesurer, vous ne pouvez pas l'améliorer. Mais l'évaluation en IA est particulièrement difficile parce que les tâches sont ouvertes et la qualité subjective. Les bancs d'essai sont manipulés, l'évaluation humaine est coûteuse, et le modèle qui obtient le meilleur score sur papier n'est souvent pas le meilleur en pratique. Construire de bonnes évaluations est un superpouvoir.
ElevenLabs
Synthèse vocale, clonage vocal, doublage
Compagnies
Entreprise d'IA vocale qui a rendu la synthèse vocale ultraréaliste accessible à tous. Leur technologie alimente le clonage vocal, le doublage en temps réel et la synthèse vocale dans 32 langues, brouillant la frontière entre voix humaines et voix générées par IA.
Pourquoi c’est important : ElevenLabs a prouvé que la parole générée par IA pouvait franchir la vallée de l'étrangeté et sonner véritablement humaine, réduisant le coût et le temps de production vocale professionnelle de plusieurs ordres de grandeur. Leurs outils de clonage vocal et de doublage multilingue ont rendu possible pour un créateur solo de produire du contenu dans plus de 30 langues sans engager un seul acteur vocal, transformant fondamentalement l'économie de la localisation audio et vidéo. Ils ont aussi forcé l'industrie entière à affronter de front l'éthique de la technologie vocale synthétique, favorisant l'adoption du filigranage, des normes de provenance de contenu et des protocoles de vérification qui deviennent désormais la norme.
Embedding
Plongement vectoriel
Entraînement
Une façon de représenter du texte (ou des images, ou de l'audio) sous forme d'une liste de nombres (un vecteur) qui en capture le sens. Les concepts similaires se retrouvent proches dans cet espace numérique — « chat » et « chaton » sont voisins, tandis que « chat » et « économie » sont éloignés.
Pourquoi c’est important : Les embeddings sont le fondement de la recherche sémantique et du RAG. C'est ainsi que l'IA comprend qu'une recherche pour « corriger un bogue de connexion » devrait correspondre à un document sur la « résolution d'erreur d'authentification » même si aucun mot ne se recoupe.
Infrastructure
Une URL spécifique où une API d'IA accepte les requêtes. Par exemple, l'endpoint de messages d'Anthropic est l'endroit où vous envoyez vos prompts à Claude. Différents endpoints servent différentes fonctions : génération de texte, embeddings, création d'images, liste des modèles.
Pourquoi c’est important : Lors de l'intégration de fournisseurs d'IA, les endpoints sont là où la théorie rencontre la pratique. Chaque fournisseur structure les siens différemment, c'est pourquoi des plateformes comme Zubnet existent — pour normaliser le désordre.
IA en périphérie
IA sur appareil, IA locale
Exécuter l'IA sur les appareils des utilisateurs (téléphones, laptops, voitures) au lieu du cloud. Privé, zéro latence, fonctionne hors ligne.
Pourquoi c'est important : L'intersection vie privée + latence + coût. Un modèle 3B sur ton téléphone bat souvent un 400B dans un datacenter.
Architecture avec encodeur (compresse l'entrée) et décodeur (génère la sortie). T5/BART sont encodeur-décodeur. GPT/Claude sont décodeur seul. BERT est encodeur seul.
Pourquoi c'est important : Explique pourquoi différents modèles excellent dans différentes tâches et pourquoi le décodeur seul a gagné pour les LLM.
Risque existentiel
X-Risk, IA catastrophique
Sécurité
L'hypothèse que des systèmes d'IA suffisamment avancés pourraient constituer une menace pour l'existence humaine ou réduire de manière permanente le potentiel de l'humanité. Les préoccupations de risque existentiel vont de scénarios concrets à court terme (armes biologiques assistées par IA, armes autonomes) à des scénarios spéculatifs à long terme (une IA superintelligente poursuivant des objectifs désalignés avec les valeurs humaines). Le sujet est véritablement débattu parmi les chercheurs de pointe en IA.
Pourquoi c’est important : Le risque existentiel est le débat le plus conséquent en IA. Si le risque est réel et significatif, il devrait dominer la politique de l'IA. S'il est exagéré, s'y concentrer détourne l'attention des préjudices concrets qui se produisent aujourd'hui (biais, pertes d'emploi, désinformation). Comprendre les arguments réels — pas les caricatures — t'aide à te forger une position éclairée sur l'une des questions les plus importantes de notre époque.
Édition de connaissances
Édition de modèle, édition de faits
Entraînement
Des techniques pour modifier des faits spécifiques dans un modèle entraîné sans le réentraîner. Si un modèle affirme incorrectement "Le président de la France est Macron" après une nouvelle élection, l'édition de connaissances peut mettre à jour ce fait spécifique en modifiant des poids ciblés, sans affecter les autres connaissances ou capacités du modèle. L'objectif est la précision chirurgicale : changer un fait, laisser tout le reste intact.
Pourquoi c'est important : L'édition de connaissances répond à un problème pratique : les modèles deviennent obsolètes, et le réentraînement est coûteux. Si tu pouvais mettre à jour des faits spécifiques à moindre coût, les modèles pourraient rester à jour entre les grandes phases d'entraînement. Il y a aussi des implications de sécurité : pourrait-on retirer des connaissances dangereuses? Le domaine est prometteur mais immature — les éditions ont souvent des effets secondaires imprévus sur les connaissances connexes.
Arrêt précoce
Patience, Arrêt basé sur la validation
Entraînement
Arrêter l'entraînement quand la performance sur un ensemble de validation tenu à l'écart arrête de s'améliorer, plutôt que d'entraîner pour un nombre fixe d'étapes. Alors que l'entraînement continue, la perte d'entraînement continue de diminuer mais la perte de validation finit par augmenter — le modèle surajuste les données d'entraînement. L'arrêt précoce capture ce point d'inflexion et sauvegarde le meilleur modèle avant que la qualité ne se dégrade.
Pourquoi c'est important : L'arrêt précoce est la technique de régularisation la plus simple et la plus efficace pour le fine-tuning. Sans lui, tu risques d'entraîner trop longtemps et de détruire les capacités que tu voulais préserver. Avec lui, le modèle s'arrête automatiquement à son meilleur point. Le paramètre « patience » (combien d'évaluations sans amélioration avant d'arrêter) est l'un des hyperparamètres les plus importants en fine-tuning.
Encodeur
Réseau encodeur, Extracteur de caractéristiques
Fondamentaux
Un composant de réseau de neurones qui convertit des données d'entrée en une représentation compressée et riche en information (encodage). Dans les Transformers, l'encodeur utilise l'attention bidirectionnelle pour traiter l'entrée complète et produire des représentations contextuelles. Dans les auto-encodeurs, l'encodeur compresse l'entrée en un goulot d'étranglement latent. Dans la génération d'images, l'encodeur VAE convertit les images en espace latent. Les encodeurs sont la moitié « compréhension » de nombreuses architectures.
Pourquoi c'est important : Les encodeurs sont partout : BERT est un encodeur, CLIP a un encodeur texte et un encodeur image, Stable Diffusion a un encodeur VAE, les systèmes RAG utilisent des modèles encodeurs pour les embeddings. Comprendre ce que fait un encodeur — compresser l'entrée en une représentation utile — t'aide à comprendre tous ces systèmes. La qualité de l'encodage détermine la qualité de tout ce qui suit.
Extraction d'information
IE, extraction structurée
Utiliser l'AI
Extraire automatiquement de l'information structurée à partir de texte non structuré. À partir d'un article de presse, extraire : qui a fait quoi, quand, où et pourquoi. À partir d'un contrat, extraire : parties, dates, obligations et montants. L'IE combine la NER (trouver les entités), l'extraction de relations (trouver les connexions entre entités), et l'extraction d'événements (trouver ce qui s'est passé) dans un pipeline unifié.
Pourquoi c'est important : La plupart de l'information mondiale est piégée dans du texte non structuré — courriels, rapports, articles, documents juridiques, dossiers médicaux. L'extraction d'information transforme ce texte en données structurées qui peuvent être recherchées, analysées et exploitées. C'est la technologie qui te permet de poser une question de type base de données sur une pile de documents.
Estimation de pose
Pose corporelle, détection de squelette, détection de points clés
Utiliser l'AI
Détecter la position et l'orientation d'un corps humain (ou animal, main, visage) dans une image ou une vidéo en localisant des points anatomiques clés — articulations, repères faciaux, bouts des doigts. La sortie est un squelette : un ensemble de points clés connectés représentant la pose du corps. OpenPose, MediaPipe et YOLO-Pose sont des implémentations populaires.
Pourquoi c'est important : L'estimation de pose permet : les applications de fitness qui analysent la forme des exercices, la reconnaissance de la langue des signes, la capture de mouvement pour l'animation, les interfaces de contrôle gestuel, l'analyse sportive et la détection de chutes pour les soins aux personnes âgées. Dans la génération d'images IA, les squelettes de pose servent d'entrées ControlNet — tu spécifies la pose exacte du corps souhaitée et le modèle génère une personne dans cette pose.
F
Fiche de modèle
Documentation de modèle, fiche technique
Sécurité
Un document standardisé qui décrit l'usage prévu d'un modèle d'apprentissage automatique, ses caractéristiques de performance, ses données d'entraînement, ses limitations et ses considérations éthiques. Introduites par Mitchell et al. (2019), les fiches de modèle visent à augmenter la transparence et à aider les utilisateurs à prendre des décisions éclairées sur l'adéquation d'un modèle à leur cas d'usage.
Pourquoi c'est important : Les fiches de modèle sont les étiquettes nutritionnelles de l'IA. Sans elles, tu utilises un modèle à l'aveugle — tu ne sais pas sur quelles données il a été entraîné, sur quoi il performe bien ou mal, ou quels groupes il pourrait désavantager. Alors que la réglementation de l'IA s'intensifie (l'AI Act européen exige de la documentation), les fiches de modèle passent de bonne pratique à exigence légale.
Entraînement
Prendre un modèle pré-entraîné et poursuivre son entraînement sur un jeu de données plus petit et spécifique pour spécialiser son comportement. Comme prendre un médecin généraliste et le faire passer par une résidence en chirurgie — mêmes connaissances de base, nouvelle expertise.
Pourquoi c’est important : Le fine-tuning est la façon dont les modèles génériques deviennent utiles pour des tâches spécifiques. Un modèle ajusté peut apprendre le ton de votre entreprise, la terminologie de votre domaine ou un format de sortie spécifique sans repartir de zéro.
Fondamentaux
Un grand modèle entraîné sur des données générales qui sert de base à une multitude de tâches différentes. Claude, GPT, Gemini et Llama sont tous des foundation models. On les appelle « fondamentaux » parce qu'ils peuvent être adaptés à presque tout — rédaction, programmation, analyse, compréhension d'images — sans avoir été spécifiquement entraînés pour chaque tâche.
Pourquoi c’est important : Les foundation models ont changé l'économie de l'IA. Au lieu d'entraîner un modèle distinct pour chaque tâche, on entraîne un seul modèle massif une fois, puis on le fine-tune ou on le sollicite par prompt pour des besoins spécifiques.
Few-Shot
Apprentissage en contexte
Fournir des paires d'exemples entrée-sortie dans ton prompt. Zero-shot = pas d'exemples, few-shot = 2 à 10. Le modèle apprend le pattern sans entraînement.
Pourquoi c'est important : La façon la plus rapide et la moins chère de personnaliser le comportement. Une des capacités émergentes les plus surprenantes.
Flow Matching
Rectified Flow
Technique générative : apprend des chemins lisses et directs du bruit vers les données. Moins d'étapes que la diffusion pour une qualité comparable.
Pourquoi c'est important : En train de remplacer la diffusion pour l'état de l'art image/vidéo. Flux, SD3 l'utilisent. Moins d'étapes = plus rapide = moins cher.
Appel de fonctions
Appel d'outils, API d'utilisation d'outils
Une façon structurée pour les modèles d'IA de demander l'exécution de fonctions externes pendant une conversation. Tu définis des fonctions avec des noms, descriptions et schémas de paramètres. Quand le modèle détermine qu'une fonction aiderait à répondre à une requête, il produit un appel de fonction structuré (avec des arguments) au lieu de texte. Ton code exécute la fonction et retourne le résultat que le modèle peut intégrer.
Pourquoi c'est important : L'appel de fonctions est ce qui transforme un chatbot en agent. Sans lui, un modèle ne peut que générer du texte. Avec, un modèle peut chercher dans des bases de données, appeler des API, exécuter des calculs, prendre des rendez-vous, envoyer des courriels — tout ce que tu peux exposer comme fonction. C'est le mécanisme derrière chaque assistant IA qui fait réellement des choses au lieu de juste en parler.
Flash Attention
FlashAttention, FlashAttention-2
Infrastructure
Une implémentation de l'attention optimisée pour GPU qui est 2 à 4 fois plus rapide et utilise significativement moins de mémoire que l'attention standard. Flash Attention y parvient non pas en changeant ce que l'attention calcule, mais en restructurant la façon dont le calcul est effectué sur le matériel GPU — en minimisant les transferts mémoire lents entre la HBM du GPU et la SRAM sur puce.
Pourquoi c’est important : Flash Attention est sans doute l'optimisation système la plus impactante en IA moderne. Elle a rendu les modèles à long contexte pratiques en réduisant l'utilisation mémoire de l'attention de quadratique à quasi-linéaire (en pratique), permettant directement le saut de 4K à 128K+ tokens de contexte. Tous les grands LLM l'utilisent. Sans Flash Attention, les modèles à long contexte d'aujourd'hui seraient d'un coût prohibitif.
Fondamentaux
Le composant dans chaque couche Transformer qui traite chaque token indépendamment à travers deux transformations linéaires avec une fonction d'activation entre les deux. Tandis que l'attention mélange l'information entre les tokens (quels tokens sont liés à quels autres), le réseau feed-forward traite la représentation de chaque token individuellement, appliquant des transformations non linéaires qui encodent des connaissances et effectuent des calculs.
Pourquoi c’est important : Le réseau feed-forward est l'endroit où la majorité des connaissances d'un Transformer sont stockées. L'attention reçoit toute la gloire, mais les couches FFN contiennent la majorité des paramètres du modèle (typiquement 2/3 des paramètres totaux) et c'est là que résident principalement les associations factuelles, les patterns langagiers et les calculs appris. Comprendre cela aide à expliquer des phénomènes comme l'édition de connaissances et l'élagage de modèles.
FLOPs
Floating Point Operations, FLOP/s, calcul
Fondamentaux
Floating Point Operations — la mesure standard du travail de calcul en IA. Entraîner un modèle nécessite un certain nombre de FLOPs (opérations totales). Le matériel est évalué en FLOP/s (opérations par seconde). Un GPU H100 peut effectuer ~2 000 TFLOP/s (2 billiards d'opérations par seconde) en FP16. L'entraînement de GPT-4 est estimé à ~10^25 FLOPs — un nombre si grand qu'il est difficile à concevoir.
Pourquoi c’est important : Les FLOPs sont la monnaie du calcul en IA. Les lois d'échelle sont exprimées en FLOPs. Les budgets d'entraînement sont mesurés en FLOPs. Les comparaisons de GPU utilisent les FLOP/s. Comprendre les FLOPs t'aide à estimer les coûts d'entraînement, comparer le matériel et comprendre pourquoi le progrès en IA est si étroitement lié à la mise à l'échelle du calcul. Quand les gens disent "mettre à l'échelle le calcul", ils veulent dire dépenser plus de FLOPs.
Fusion de modèles
TIES, DARE, SLERP, Frankenmerge
Entraînement
Combiner les poids de plusieurs modèles fine-tunés en un seul modèle sans entraînement supplémentaire. Si le modèle A excelle en codage et le modèle B en écriture créative, les fusionner peut produire un modèle bon dans les deux. Les méthodes de fusion populaires incluent SLERP (interpolation sphérique), TIES (résolution des conflits de signe) et DARE (suppression aléatoire de paramètres avant la fusion).
Pourquoi c'est important : La fusion de modèles est l'arme secrète de la communauté open-source. Elle ne coûte aucun calcul (juste des maths sur les tenseurs de poids) et peut produire des modèles qui surpassent leurs composants. De nombreux modèles en tête de l'Open LLM Leaderboard sont des fusions. C'est aussi la façon dont les praticiens combinent plusieurs fine-tunes LoRA en un seul modèle polyvalent. Comprendre la fusion débloque une capacité puissante et gratuite pour quiconque travaille avec des modèles ouverts.
Reconnaissance faciale
Reconnaissance de visages, Face ID
Sécurité
Identifier ou vérifier une personne à partir de son visage dans une image ou vidéo. La vérification demande « est-ce que cette personne est bien celle qu'elle prétend être? » (correspondance 1:1, utilisée pour déverrouiller un téléphone). L'identification demande « qui est cette personne? » (correspondance 1:N contre une base de données, utilisée en surveillance). Les systèmes modernes utilisent le deep learning pour extraire des embeddings faciaux et les comparer, atteignant une précision surhumaine dans des conditions contrôlées.
Pourquoi c'est important : La reconnaissance faciale est l'une des applications IA les plus puissantes et les plus controversées. Elle permet l'authentification pratique (Face ID), aide à retrouver les personnes disparues, et assiste les forces de l'ordre. Elle permet aussi la surveillance de masse, soulève de sérieuses préoccupations de vie privée, et présente des disparités de précision documentées entre les démographies — avec de moins bons résultats pour les femmes et les personnes à la peau plus foncée. C'est un cas d'école de technologie à double usage.
G
Gabarit de prompt
Template, pattern de prompt
Utiliser l'IA
Une structure de prompt réutilisable avec des espaces réservés variables qui sont remplis avec des données spécifiques au moment de l'exécution. Au lieu d'écrire un nouveau prompt à partir de zéro pour chaque demande utilisateur, tu définis un gabarit une fois — « Résume le {type_de_document} suivant en {langue}, en te concentrant sur {sujet} » — et tu remplis les variables. Les gabarits de prompt sont les briques de base des applications IA en production.
Pourquoi c'est important : Chaque application IA en production utilise des gabarits de prompt. Ils assurent la cohérence, permettent les tests et séparent la logique du prompt (écrite par un développeur) du contenu dynamique (fourni par les utilisateurs ou les données). Les bons gabarits sont testés, versionnés et itérés — ce sont du code, pas du texte improvisé. Comprendre la conception de gabarits de prompt est essentiel pour construire des applications IA fiables.
Fondamentaux
Les systèmes d'IA qui génèrent du contenu nouveau — texte, images, audio, vidéo, code, modèles 3D — plutôt que d'analyser ou de classer des données existantes. L'IA générative est le terme englobant pour tout, de la rédaction d'essais par ChatGPT à la création d'images par Stable Diffusion en passant par la composition de musique par Suno. Le terme « générative » distingue ces modèles des anciens systèmes d'IA qui ne pouvaient que catégoriser, prédire ou recommander.
Pourquoi c’est important : L'intelligence artificielle générative est le terme qui a introduit l'IA dans la culture grand public. C'est ce que les gens entendent lorsqu'ils disent « IA » entre 2024 et 2026 — la capacité de créer, et non seulement de calculer. Comprendre cette catégorie vous aide à naviguer dans le paysage : les LLM génèrent du texte, les modèles de diffusion génèrent des images, et les frontières entre les modalités s'estompent rapidement.
Google DeepMind
Gemini, AlphaGo, AlphaFold
Compagnies
La division unifiée de recherche en IA de Google, formée par la fusion de DeepMind et Google Brain en 2023. Derrière Gemini, AlphaGo, AlphaFold et une grande partie de la recherche fondamentale qui alimente l'IA moderne.
Pourquoi c’est important : Google DeepMind a contribué plus de recherche fondamentale à l'IA moderne que toute autre organisation — l'architecture transformer, les avancées majeures en apprentissage par renforcement, la prédiction de la structure des protéines et les lois d'échelle remontent toutes à des équipes de DeepMind ou de Google Brain. Leurs modèles Gemini sont les seuls grands modèles de langage de pointe dotés d'une distribution véritablement mondiale intégrée, atteignant des milliards d'utilisateurs via Search, Android et Google Workspace. Et AlphaFold à lui seul — qui a résolu un problème vieux de cinquante ans en biologie et obtenu un prix Nobel — suffirait à assurer leur place dans l'histoire de la science, et pas seulement dans celle de l'IA.
GAN
Réseau antagoniste génératif
Modèles
Une architecture de modèle où deux réseaux de neurones s'affrontent : un générateur crée de fausses données, et un discriminateur tente de distinguer le vrai du faux. Grâce à ce jeu adversarial, le générateur s'améliore dans la création de sorties réalistes. A dominé la génération d'images de 2014 à environ 2022.
Pourquoi c’est important : Les GAN ont été les pionniers de la génération réaliste d'images par IA et sont encore utilisés dans certaines applications en temps réel. Mais les modèles de diffusion les ont largement remplacés pour les travaux exigeants en qualité, parce que les GAN sont plus difficiles à entraîner et moins diversifiés dans leurs sorties.
GPU
Unité de traitement graphique
Infrastructure
Conçus à l'origine pour le rendu graphique, les GPU se sont avérés parfaits pour l'IA parce qu'ils peuvent effectuer des milliers d'opérations mathématiques simultanément. L'entraînement et l'exécution de modèles d'IA consistent essentiellement en une multiplication matricielle massive — exactement ce pour quoi les GPU sont conçus. NVIDIA domine ce marché.
Pourquoi c’est important : Les GPU sont le goulot d'étranglement physique de toute l'industrie de l'IA. Pourquoi les modèles coûtent ce qu'ils coûtent, pourquoi certains fournisseurs sont plus rapides que d'autres, pourquoi il y a une pénurie mondiale de puces — tout revient à l'offre de GPU et à la VRAM.
Utiliser l’AI
Connecter les réponses d'un modèle à des sources factuelles et vérifiables plutôt que de le laisser se fier uniquement à ses données d'entraînement. Les techniques d'ancrage incluent le RAG, l'intégration de la recherche web et les exigences de citation. Une réponse ancrée dit « selon [source] » plutôt que d'affirmer des faits sans référence.
Pourquoi c’est important : L'ancrage est la défense principale contre l'hallucination. Un modèle non ancré invente des faits en toute confiance. Un modèle ancré vous dirige vers des sources réelles que vous pouvez vérifier.
Sécurité
Des mécanismes de sécurité qui empêchent les modèles d'IA de générer du contenu nuisible, inapproprié ou hors sujet. Les garde-fous peuvent être intégrés au modèle pendant l'entraînement (RLHF), appliqués via des prompts système, ou imposés par des filtres externes qui vérifient les sorties avant qu'elles n'atteignent les utilisateurs.
Pourquoi c’est important : Sans garde-fous, les modèles aideront volontiers avec des demandes dangereuses. Le défi est la calibration — trop stricts et le modèle devient inutile (« Je ne peux pas vous aider avec ça »), trop lâches et il devient dangereux.
Descente de gradient
SGD, Rétropropagation
Ajuste itérativement les paramètres pour réduire la perte en calculant les gradients et en descendant la pente. La rétropropagation calcule efficacement les gradients à travers les couches.
Pourquoi c'est important : Chaque modèle a été entraîné par descente de gradient. Explique l'importance du learning rate, la divergence, pourquoi Adam marche.
Groq
Groq LPU
Puces d'inférence IA custom (LPU). Conçues expressément pour la génération séquentielle de tokens. 500–800 tok/s, souvent 10x plus rapide que les GPU.
Pourquoi c'est important : A prouvé que l'inférence n'a pas à être lente. Approche matérielle vs optimisation logicielle.
GGUF
GGML Unified Format
Infrastructure
Le format de fichier standard pour exécuter des modèles de langage quantifiés localement via llama.cpp, Ollama et d'autres outils d'inférence locale. Les fichiers GGUF contiennent les poids du modèle dans un format quantifié (réduisant la précision de 16 bits à 4 ou 8 bits), ainsi que des métadonnées comme le vocabulaire, les détails d'architecture et les paramètres de quantification — tout le nécessaire pour charger et exécuter le modèle dans un seul fichier.
Pourquoi c’est important : GGUF est le format qui a rendu l'IA locale pratique. Avant lui, exécuter des modèles localement nécessitait des configurations complexes avec PyTorch, CUDA et une mémoire GPU spécifique. GGUF emballe tout dans un seul fichier que llama.cpp ou Ollama peut charger directement — sur CPU, sur Apple Silicon, sur des GPU de gaming, partout. Si tu vois un modèle sur Hugging Face avec des noms de fichiers comme « Q4_K_M.gguf », c'est un modèle prêt pour l'utilisation locale.
GNN
Réseau de neurones de graphes
Modèles
Des réseaux de neurones conçus pour opérer sur des données structurées en graphe — des données où les entités sont connectées par des relations (réseaux sociaux, molécules, graphes de connaissances, réseaux de transport). Les GNN apprennent en passant des messages entre nœuds connectés, permettant à chaque nœud de mettre à jour sa représentation en fonction de ses voisins. Ils gèrent les données qui ne s'inscrivent pas naturellement dans des grilles (images) ou des séquences (texte).
Pourquoi c’est important : Toutes les données ne sont pas du texte ou des images. Les réseaux sociaux, les structures moléculaires, les systèmes de recommandation, les réseaux de détection de fraude et les itinéraires logistiques sont tous naturellement structurés en graphe. Les GNN sont le bon outil quand les relations entre entités sont aussi importantes que les entités elles-mêmes. La découverte de médicaments, l'analyse de réseaux sociaux et la prédiction de trafic reposent tous sur les GNN.
GQA
Grouped Query Attention
Fondamentaux
Une variante d'attention où plusieurs têtes de queries partagent une seule tête key-value, réduisant la taille du KV cache sans réduire significativement la qualité. Au lieu que chaque tête de query ait ses propres projections K et V (MHA standard), des groupes de têtes de queries partagent les projections K et V. Llama 2 70B, Mistral, Gemma et la plupart des LLM modernes utilisent GQA.
Pourquoi c’est important : GQA est la solution pratique au problème de mémoire du KV cache. L'attention multi-tête standard avec 64 têtes nécessite 64 jeux de tenseurs K et V par couche dans le cache. GQA avec 8 têtes KV réduit cela à 8 jeux — une réduction de mémoire de 8x. Cela se traduit directement par plus d'utilisateurs simultanés ou des contextes plus longs sur le même matériel.
Gradient Checkpointing
Activation checkpointing, rematérialisation
Entraînement
Une technique d'économie de mémoire qui échange du calcul contre de la mémoire pendant l'entraînement. Au lieu de stocker toutes les activations intermédiaires de la passe forward (nécessaires pour la rétropropagation), le gradient checkpointing ne stocke les activations qu'à certaines couches "checkpoint" et recalcule les autres pendant la passe backward. Cela réduit l'utilisation mémoire jusqu'à 5–10x au prix d'environ 30% de calcul en plus.
Pourquoi c’est important : Le gradient checkpointing est ce qui rend possible le fine-tuning de grands modèles sur une mémoire GPU limitée. Sans lui, un modèle 7B pourrait nécessiter 80+ Go juste pour les activations pendant l'entraînement, dépassant la capacité d'un seul GPU. Avec le gradient checkpointing, le même modèle peut être fine-tuné sur un GPU grand public de 24 Go. C'est l'optimisation mémoire la plus couramment utilisée pour l'entraînement.
Échelle de guidage
Échelle CFG, Classifier-Free Guidance
Utiliser l'AI
Un paramètre qui contrôle la force avec laquelle un modèle de génération d'images suit le prompt textuel. Guidage faible (1–3) : le modèle génère librement, produisant des images diversifiées mais potentiellement hors sujet. Guidage élevé (7–15) : le modèle suit strictement le prompt mais peut produire des images saturées et pleines d'artefacts. Le point optimal est typiquement 7–9. C'est l'équivalent en génération d'images de la température pour les modèles textuels.
Pourquoi c'est important : L'échelle de guidage est le paramètre le plus impactant en génération d'images après le prompt lui-même. Trop bas et l'image ignore ta description. Trop haut et elle a l'air sursaturée et artificielle. Comprendre l'échelle de guidage t'aide à diagnostiquer « pourquoi mon image ne correspond pas à mon prompt? » (guidage trop bas) et « pourquoi mon image a l'air bizarre? » (guidage trop haut).
H
Hyperparamètres
Hyperparamètres d'entraînement
Entraînement
Les hyperparamètres que vous choisissez avant le début de l'entraînement, qui contrôlent la manière dont le modèle apprend — contrairement aux paramètres, que le modèle apprend par lui-même. Les hyperparamètres comprennent le taux d'apprentissage (la taille de chaque étape de mise à jour), la taille du lot (le nombre d'exemples traités à la fois), le nombre d'époques (le nombre de fois où les données sont parcourues), le choix de l'optimiseur (Adam, SGD, AdamW), la décroissance du poids, le taux de dropout et les décisions relatives à l'architecture, comme le nombre de couches et les dimensions cachées. Régler correctement les hyperparamètres est souvent la différence entre un modèle qui converge de manière optimale et un autre qui diverge vers des résultats incohérents.
Pourquoi c’est important : L'ajustement des hyperparamètres est l'endroit où l'ingénierie ML devient à la fois science et artisanat. Vous pouvez avoir le jeu de données parfait et l'architecture idéale, mais un taux d'apprentissage trop élevé risque de faire échouer l'entraînement, tandis qu'un taux trop faible ne convergera jamais. Comprendre les hyperparamètres est essentiel pour toute personne entraînant ou effectuant un fine-tuning de modèles — et savoir lesquels sont les plus importants économise d'énormes quantités de ressources de calcul.
HeyGen
Vidéos avatar IA, doublage avec synchro labiale
Compagnies
Plateforme vidéo IA spécialisée dans les avatars réalistes de type « tête parlante » et le doublage automatique avec synchronisation labiale. Utilisée par les entreprises pour le marketing, la formation et la localisation — transformant une seule vidéo en des dizaines de langues avec des mouvements de lèvres synchronisés.
Pourquoi c’est important : HeyGen a transformé les avatars vidéo IA d'une curiosité de recherche en un véritable outil d'entreprise, prouvant qu'il existe un revenu réel à rendre la création de contenu vidéo aussi simple que la rédaction d'un document. Leur technologie de doublage avec synchronisation labiale a une importance particulière pour les entreprises internationales — elle réduit considérablement le coût et le temps de localisation vidéo, passant de semaines et de milliers de dollars à quelques minutes et quelques sous. En tant que l'une des rares entreprises de vidéo IA avec des revenus récurrents substantiels, HeyGen sert également d'étude de cas sur la manière de bâtir une entreprise viable sur l'IA générative, et pas seulement une démonstration.
HiDream
Modèles de génération d'images HiDream
Compagnies
Entreprise émergente de génération d'images qui développe des modèles de diffusion de haute qualité. Leurs publications à poids ouverts ont gagné en popularité dans la communauté de l'IA créative grâce à une forte adhérence aux instructions et une qualité visuelle remarquable.
Pourquoi c’est important : HiDream a démontré qu'une petite équipe concentrée peut produire des modèles de génération d'images à poids ouverts qui rivalisent avec les résultats d'organisations dépensant des ordres de grandeur supérieurs en infrastructure d'entraînement. La force de leurs modèles en rendu de texte et en précision compositionnelle a résolu de véritables irritants qui freinaient l'adoption commerciale des images générées par IA. Dans l'espace des modèles d'images ouverts qui se banalise rapidement, le succès d'HiDream renforce le constat que le prochain bond en qualité peut venir de n'importe où — pas seulement des plus grands laboratoires disposant du plus grand nombre de GPU.
Hume
Interface vocale empathique, détection d'émotions
Compagnies
Entreprise d'IA qui développe des modèles capables de comprendre et d'exprimer les émotions humaines. Leur Empathic Voice Interface détecte le ton, le sentiment et le contexte émotionnel en temps réel, permettant des conversations IA qui répondent non seulement à ce que vous dites, mais à comment vous le dites.
Pourquoi c’est important : Hume compte parce qu'elle s'attaque à l'angle mort le plus flagrant de l'IA moderne : la compréhension émotionnelle. Chaque agent conversationnel, assistant vocal et agent IA d'aujourd'hui est essentiellement sourd aux nuances, répondant au contenu littéral des mots tout en ignorant le contexte émotionnel sur lequel les humains comptent instinctivement. L'Empathic Voice Interface de Hume est la première tentative sérieuse de combler cette lacune à l'échelle de la production, et leur insistance sur des lignes directrices éthiques pour l'IA émotionnelle établit une norme que l'industrie sera éventuellement obligée d'adopter.
Utiliser l’AI
Quand un modèle d'IA génère de l'information qui semble confiante et plausible mais qui est factuellement fausse ou entièrement fabriquée. Le modèle ne « ment » pas — il fait de la correspondance de patrons vers un texte fluide sans concept de vérité. Les fausses citations, les statistiques inventées et les méthodes d'API inexistantes sont des exemples courants.
Pourquoi c’est important : L'hallucination est le plus grand problème de confiance en IA aujourd'hui. C'est pourquoi vous devriez toujours vérifier les faits critiques provenant des sorties d'IA, et pourquoi des techniques comme le RAG et l'ancrage existent.
Le hub central de l'IA open source. 500K+ modèles, 100K+ datasets, la bibliothèque Transformers, Spaces. Le GitHub de l'IA.
Pourquoi c'est important : Si tu utilises des modèles open-weight, tu utilises HF. La bibliothèque Transformers est le standard de facto.
Ajustement d'hyperparamètres
HPO, Optimisation d'hyperparamètres, Recherche en grille
Entraînement
Rechercher systématiquement les meilleurs hyperparamètres — les choix de configuration qui ne sont pas appris pendant l'entraînement mais doivent être fixés avant qu'il ne commence. Le taux d'apprentissage, la taille de lot, le nombre de couches, le taux de dropout et le rang LoRA sont tous des hyperparamètres. Les méthodes d'ajustement incluent la recherche en grille (essayer toutes les combinaisons), la recherche aléatoire (essayer des combinaisons aléatoires) et l'optimisation bayésienne (utiliser les résultats passés pour guider la recherche).
Pourquoi c'est important : La différence entre un bon et un mauvais ensemble d'hyperparamètres peut être énorme — un mauvais taux d'apprentissage peut faire diverger l'entraînement ou converger vers une solution médiocre. L'ajustement d'hyperparamètres est la façon de tirer le meilleur de ton architecture de modèle et de tes données. Pour le fine-tuning de LLM, le taux d'apprentissage et le nombre d'époques sont typiquement les hyperparamètres les plus impactants à ajuster.
I
Ideogram
Rendu de texte dans les images, Ideogram 2.0
Compagnies
Entreprise de génération d'images par IA fondée par d'anciens chercheurs de Google Brain. Elle s'est fait un nom en résolvant l'un des problèmes les plus ardus de la génération d'images : le rendu de texte lisible et précis à l'intérieur des images.
Pourquoi c’est important : Ideogram a prouvé que résoudre une seule faiblesse critique — un texte lisible dans les images générées par IA — pouvait créer une position de marché distincte dans l'espace bondé de la génération d'images. Leur évolution de spécialistes du rendu de texte à plateforme de design complète montre comment la différenciation technique, lorsqu'elle vise de vrais irritants dans les flux de travail, peut rivaliser avec des concurrents mieux financés.
Infrastructure
Le processus d'exécution d'un modèle entraîné pour générer des sorties. L'entraînement, c'est apprendre; l'inférence, c'est utiliser ce qui a été appris. Chaque fois que vous envoyez un prompt à Claude ou générez une image avec Stable Diffusion, c'est de l'inférence. C'est ce qui coûte des heures GPU aux fournisseurs et ce pour quoi vous payez par token.
Pourquoi c’est important : Le coût et la vitesse d'inférence déterminent l'économie des produits d'IA. Une inférence plus rapide = moins de latence = meilleure expérience utilisateur. Une inférence moins chère = prix plus bas = adoption plus large. Toute l'industrie de la quantification et de l'optimisation existe pour rendre l'inférence plus efficace.
Ajustement par instructions
Instruction Fine-Tuning, IFT, SFT
Entraînement
L'ajustement fin d'un modèle de langage pré-entraîné sur un jeu de données de paires (instruction, réponse) pour lui apprendre à suivre des instructions. Un modèle de base qui ne fait que prédire du texte devient un modèle qui répond à des questions, suit des directives et se comporte comme un assistant. C'est l'étape qui transforme GPT en ChatGPT, ou un Llama de base en Llama-Chat.
Pourquoi c’est important : L'ajustement par instructions est le pont entre un modèle de langage brut (qui ne sait que compléter du texte) et un assistant utile (qui sait suivre des instructions). Sans cette étape, même le modèle de base le plus puissant ne fait que générer du texte plausible au lieu de faire ce qu'on lui demande. C'est sans doute l'étape post-entraînement la plus importante.
Génération d'images
Text-to-image, art IA
Fondamentaux
Créer des images à partir de descriptions textuelles en utilisant des modèles d'IA. Tu tapes « un coucher de soleil sur des montagnes en style aquarelle » et le modèle génère une image correspondante. Les approches actuelles incluent les modèles de diffusion (Stable Diffusion, DALL-E), le flow matching (Flux) et les modèles autorégressifs. Le domaine a progressé de visages flous en 2020 à des résultats photoréalistes et artistiquement contrôlés en 2025.
Pourquoi c’est important : La génération d'images est la capacité IA grand public la plus visible après les chatbots. Elle transforme le design graphique, la publicité, l'art conceptuel et la communication visuelle. Comprendre les approches sous-jacentes (diffusion, flow matching, DiT) et leurs compromis t'aide à choisir le bon outil et à comprendre les limitations — pourquoi certains prompts marchent et d'autres pas, pourquoi certains styles sont plus faciles que d'autres.
Suivi d'instructions
Adhérence aux instructions
Utiliser l'IA
La capacité d'un modèle à exécuter précisément ce que l'utilisateur demande — respecter les contraintes de format, les exigences de longueur, les spécifications de style et les instructions comportementales. « Écris exactement 3 points en français sur X » teste le suivi d'instructions : la réponse doit être en points (pas en paragraphes), exactement 3 (pas 2 ou 5), en français (pas en anglais), et sur X (pas sur Y).
Pourquoi c’est important : Le suivi d'instructions est la capacité LLM la plus pratiquement importante. Les utilisateurs se soucient moins de savoir si un modèle « connaît » plus de faits et plus de savoir s'il fait ce qu'on lui a réellement demandé. Un modèle qui écrit de la belle prose mais ignore tes exigences de format est moins utile qu'un autre qui suit les instructions de manière fiable. C'est pourquoi IFEval et d'autres benchmarks de suivi d'instructions sont devenus centraux pour l'évaluation des modèles.
Tête d'induction
Induction Head
Fondamentaux
Un circuit spécifique à deux têtes d'attention découvert dans les Transformers qui implémente l'apprentissage en contexte par correspondance de patterns. Si le modèle a vu le pattern "A B" plus tôt dans le contexte et voit maintenant "A" à nouveau, la tête d'induction prédit que "B" suivra. Ce mécanisme simple est considéré comme un bloc de construction fondamental de la façon dont les LLM apprennent à partir des exemples dans leur contexte.
Pourquoi c’est important : Les têtes d'induction sont le circuit le mieux compris en interprétabilité mécaniste — un exemple concret de la façon dont les Transformers implémentent un algorithme utile à partir de poids appris. Elles expliquent pourquoi le prompting few-shot fonctionne : quand tu donnes des exemples, les têtes d'induction détectent le pattern et l'appliquent. Comprendre les têtes d'induction fournit une base pour comprendre des comportements appris plus complexes.
Segmentation d'images
Segmentation sémantique, SAM, Segmentation d'instances
Utiliser l'AI
Classifier chaque pixel d'une image dans une catégorie. La segmentation sémantique étiquette les pixels par classe (route, trottoir, bâtiment, ciel). La segmentation d'instances distingue les objets individuels (personne 1, personne 2). La segmentation panoptique fait les deux. SAM (Segment Anything Model) de Meta peut segmenter n'importe quel objet à partir d'un clic de point ou d'un prompt textuel, sans entraînement spécifique à la tâche.
Pourquoi c'est important : La segmentation fournit la compréhension la plus précise du contenu d'une image. Les voitures autonomes ont besoin de limites de route au pixel près, pas juste de boîtes englobantes. L'imagerie médicale a besoin de contours de tumeurs exacts. La retouche photo a besoin de masques d'objets précis pour la suppression de fond. La capacité de SAM à segmenter n'importe quel objet sans entraînement a rendu cette capacité auparavant spécialisée accessible à tout le monde.
Inpainting
Retouche d'image par IA, Outpainting
Utiliser l'AI
Remplir une région sélectionnée d'une image avec du contenu généré par IA qui correspond au contexte environnant. Tu masques une zone (en peignant dessus), tu décris ce qui devrait la remplacer, et le modèle génère du nouveau contenu qui se fond harmonieusement avec l'image existante. L'outpainting étend une image au-delà de ses bordures originales. Les deux utilisent le même processus de diffusion sous-jacent, conditionné sur les régions non masquées.
Pourquoi c'est important : L'inpainting est l'outil de retouche d'image le plus pratique que l'IA fournit. Supprimer les objets indésirables, remplacer les fonds, corriger les défauts, ajouter des éléments, ou modifier des parties spécifiques d'une image tout en gardant tout le reste intact. C'est l'équivalent IA du remplissage conscient du contenu de Photoshop, mais guidé par le langage naturel et dramatiquement plus capable.
Image-to-Image
img2img, conditionnement par image
Utiliser l'AI
Générer une nouvelle image à partir d'une image existante plus un prompt textuel. Au lieu de partir de bruit pur (text-to-image), le processus de diffusion part d'une version bruitée de l'image d'entrée, préservant sa structure tout en la modifiant selon le prompt. « Une version cyberpunk de cette photo » garde la composition mais transforme le style et les détails.
Pourquoi c'est important : Image-to-image est le pont entre la photographie et l'art IA. Ça te permet d'utiliser des croquis, des photos ou des œuvres existantes comme point de départ, en maintenant la disposition et la composition pendant que l'IA transforme le style, ajoute des détails ou réimagine le contenu. C'est plus contrôlable que le text-to-image parce que tu guides la sortie avec une structure visuelle, pas juste des mots.
J
Jina AI
Embeddings, API Reader, rerankers
Compagnies
Entreprise d'IA basée à Berlin spécialisée dans la recherche et les embeddings. Leurs modèles jina-embeddings et leur Reader API (qui convertit n'importe quelle URL en texte prêt pour les LLM) sont devenus une infrastructure essentielle pour les pipelines RAG à travers le monde.
Pourquoi c’est important : Jina AI a construit l'infrastructure d'embeddings et de récupération dont des milliers de systèmes RAG dépendent, prouvant qu'un outillage de recherche spécialisé peut avoir plus de valeur que d'essayer de tout faire. Leurs modèles d'embeddings à contexte long et leur Reader API résolvent deux des problèmes pratiques les plus ardus en recherche alimentée par IA — représenter fidèlement de longs documents et extraire du texte propre de pages web désordonnées — et ils l'ont fait tout en gardant les modèles de base en open source. Dans un écosystème dominé par les laboratoires généralistes, Jina démontre qu'il y a une véritable entreprise à faire une seule chose exceptionnellement bien et à la rendre très simple à utiliser pour les développeurs.
Jailbreak
Jailbreaking, prompt adversarial
Sécurité
Des techniques qui trompent un modèle d'IA pour contourner son entraînement de sécurité et générer du contenu qu'il a été conçu pour refuser — instructions pour des activités dangereuses, contenu nocif ou comportements qui violent les politiques d'utilisation du modèle. Les jailbreaks exploitent l'écart entre ce que le modèle a été entraîné à refuser et ce qu'un prompting astucieux peut obtenir.
Pourquoi c’est important : Le jailbreaking est le terrain d'essai adversarial pour la sécurité de l'IA. Chaque modèle est livré avec des garde-fous de sécurité, et chaque modèle majeur a été jailbreaké. Le jeu du chat et de la souris entre techniques de jailbreak et mesures de sécurité fait progresser l'alignement. Comprendre les jailbreaks t'aide à évaluer la robustesse réelle de la sécurité d'un modèle, plutôt que de prendre les affirmations marketing pour argent comptant.
Kling AI
Génération vidéo Kling, vidéo longue durée
Compagnies
Plateforme de vidéo par IA de Kuaishou (la deuxième plus grande plateforme de vidéo courte en Chine). A rapidement attiré l'attention internationale pour la production de certaines des vidéos générées par IA les plus physiquement cohérentes et temporellement consistantes.
Pourquoi c’est important : Kling AI a démontré que les laboratoires d'IA chinois pouvaient égaler les concurrents occidentaux à la fine pointe de la génération vidéo, produisant des résultats avec une cohérence physique et une consistance temporelle qui ont établi un nouveau standard dans le domaine. Soutenu par la plateforme à un milliard de vidéos par jour de Kuaishou et proposé à des prix agressifs à l'échelle mondiale, Kling est devenu un moteur principal de la compétition dans l'espace de la vidéo par IA, tirant la qualité vers le haut et les prix vers le bas pour l'ensemble du marché.
KV Cache
Cache clé-valeur
Stocke les tenseurs d'attention clé/valeur déjà calculés pour éviter de les recalculer à chaque nouveau token. Échange de la mémoire contre de la vitesse.
Pourquoi c'est important : Le KV cache est la raison pour laquelle l'inférence LLM est limitée par la mémoire. Un contexte de 100K sur un modèle 70B peut nécessiter ~256 Go de cache — plus que les poids.
Date de coupure des connaissances
Coupure des données d'entraînement, date de connaissance
Fondamentaux
La date après laquelle un modèle n'a pas de données d'entraînement, ce qui signifie qu'il manque de connaissances sur les événements, découvertes ou changements survenus après cette date. Si la coupure d'un modèle est avril 2024, il ne sait rien de ce qui s'est passé en mai 2024 ou après — nouveaux produits, actualités, articles scientifiques ou faits mis à jour.
Pourquoi c’est important : La date de coupure est la source de frustration la plus courante avec les assistants IA. « Pourquoi ne connaît-il pas X? » Parce que X est arrivé après l'entraînement. Cette limitation pousse à l'adoption du RAG (donner au modèle accès à l'information actuelle) et à l'utilisation d'outils (laisser le modèle chercher sur le web). Comprendre la coupure t'aide à savoir quand faire confiance au modèle et quand vérifier.
Fondamentaux
Une représentation structurée de la connaissance sous forme d'un réseau d'entités (nœuds) connectées par des relations (arêtes). « Paris (entité) est la capitale de (relation) France (entité). » Les graphes de connaissances encodent des faits d'une manière qui supporte le raisonnement, l'interrogation et la découverte. Le Knowledge Graph de Google, Wikidata et les graphes de connaissances d'entreprise propulsent la recherche, les recommandations et l'intégration de données.
Pourquoi c’est important : Les graphes de connaissances complètent les LLM en fournissant des faits structurés et vérifiables que les LLM peuvent interroger au lieu d'halluciner. Tandis que les LLM stockent les connaissances implicitement dans les poids (et se trompent parfois), les graphes de connaissances les stockent explicitement dans des triplets qui peuvent être vérifiés et mis à jour. La combinaison de LLM (pour comprendre le langage naturel) et de KG (pour l'ancrage dans les faits) est un pattern puissant pour l'IA d'entreprise.
LSTM
Long Short-Term Memory
Modèles
Un type de réseau de neurones récurrent (RNN) conçu pour apprendre les dépendances à longue portée dans les données séquentielles. Le LSTM introduit un « état de cellule » — une autoroute de mémoire qui peut transporter l'information inchangée sur de nombreux pas de temps — contrôlée par trois portes : une porte d'entrée (quoi ajouter), une porte d'oubli (quoi retirer) et une porte de sortie (quoi exposer). Inventé en 1997, le LSTM a dominé la modélisation de séquences jusqu'à l'arrivée des Transformers.
Pourquoi c'est important : Le LSTM a été la colonne vertébrale du NLP pendant une décennie (les années 2010) : traduction automatique, reconnaissance vocale, génération de texte et analyse de sentiment tournaient tous sur des LSTM. Comprendre le LSTM t'aide à comprendre pourquoi les Transformers l'ont remplacé (parallélisme et attention à longue portée vs. traitement séquentiel et état compressé) et pourquoi les SSM comme Mamba sont intéressants (ils revisitent l'idée d'état à portes avec des améliorations modernes).
Leonardo.ai
Génération d'images créatives, création d'assets de jeu
Compagnies
Plateforme australienne de génération d'images par IA qui s'est taillé une place entre Midjourney et Stable Diffusion. Populaire auprès des développeurs de jeux vidéo et des artistes numériques pour ses modèles affinés, son canevas en temps réel et son accent sur les actifs créatifs prêts pour la production.
Pourquoi c’est important : Leonardo.ai a montré que la génération d'images par IA pouvait être présentée comme une plateforme créative professionnelle, et non comme une simple boîte à instructions comme curiosité, et que cela pouvait attirer des dizaines de millions d'utilisateurs. Leur concentration sur le développement de jeux vidéo et les flux de travail d'art numérique a ouvert des cas d'utilisation pour lesquels des outils plus larges comme Midjourney et DALL-E n'étaient pas spécifiquement conçus. L'acquisition par Canva a validé toute la catégorie de la génération d'images par IA comme un actif stratégique pour les grandes plateformes de design, établissant le modèle de la façon dont les outils d'IA autonomes sont absorbés dans des écosystèmes créatifs plus vastes.
Liquid AI
Liquid Foundation Models, réseaux de neurones liquides
Compagnies
Entreprise issue du MIT explorant des architectures de réseaux de neurones fondamentalement différentes, inspirées des circuits neuronaux biologiques. Leurs Liquid Foundation Models utilisent des dynamiques en temps continu plutôt que des transformers à poids fixes, promettant une meilleure efficacité et adaptabilité.
Pourquoi c’est important : Liquid AI représente le défi financé le plus sérieux à l'hypothèse que les transformers sont la seule architecture qui compte. En construisant des modèles fondation de qualité production sur des dynamiques en temps continu inspirées de la biologie, ils testent si le pari tout-en-un de l'industrie de l'IA sur les mécanismes d'attention était prématuré. Même si les LFM ne détrônent pas complètement les transformers, leurs avantages en efficacité pour le déploiement en périphérie et le traitement de longues séquences pourraient se tailler des créneaux essentiels en robotique, en IA mobile et en systèmes embarqués — des marchés où faire tourner un transformer de 70 milliards de paramètres n'est tout simplement pas envisageable.
Luma AI
Dream Machine, Ray2
Compagnies
Entreprise d'IA spécialisée en génération de vidéo et de contenu 3D. Leur Dream Machine a été l'un des premiers générateurs vidéo par IA accessibles et de haute qualité, et Ray2 a considérablement fait progresser la qualité et la cohérence vidéo.
Pourquoi c’est important : Luma AI a démocratisé la génération vidéo par IA de la même façon que Stable Diffusion a démocratisé les images — en la rendant gratuite, rapide et accessible à quiconque disposait d'un navigateur. Leur évolution de startup de capture 3D à générateur vidéo de premier plan, combinée à une profondeur technique unique en compréhension spatiale, les positionne comme l'une des rares entreprises qui pourrait véritablement combler le fossé entre la vidéo par IA, le contenu 3D et les formats de médias immersifs qui suivront.
Latence
Time to First Token (TTFT)
Infrastructure
Le délai entre l'envoi d'une requête et l'obtention de la première réponse. En IA, cela se mesure souvent en Time to First Token (TTFT) — combien de temps avant que le modèle commence à diffuser sa réponse. Affectée par la taille du modèle, la charge du serveur, la distance réseau et la longueur du prompt.
Pourquoi c’est important : Les utilisateurs perçoivent tout ce qui dépasse environ 2 secondes comme lent. La faible latence est la raison pour laquelle les petits modèles l'emportent souvent pour les applications en temps réel, même quand les grands modèles sont « plus intelligents ». C'est un facteur de différenciation clé entre les fournisseurs.
Fondamentaux
Un réseau de neurones entraîné sur d'énormes quantités de texte pour comprendre et générer du langage humain. « Large » fait référence au nombre de paramètres (des milliards) et à la taille des données d'entraînement (des milliers de milliards de tokens). Claude, GPT, Gemini, Llama et Mistral sont tous des LLM.
Pourquoi c’est important : Les LLM sont la technologie derrière chaque chat IA, assistant de code et générateur de texte que vous utilisez. Comprendre ce qu'ils sont (des appariements statistiques de patterns, pas des êtres sentients) vous aide à les utiliser efficacement et à reconnaître leurs limites.
LoRA
Adaptation à faible rang
Entraînement
Une technique qui rend le fine-tuning radicalement moins coûteux en n'entraînant qu'un petit nombre de paramètres supplémentaires au lieu de modifier le modèle entier. Les adaptateurs LoRA sont des extensions légères (souvent quelques mégaoctets) qui modifient le comportement d'un modèle sans réentraîner ses milliards de paramètres.
Pourquoi c’est important : LoRA a démocratisé le fine-tuning. Avant, personnaliser un modèle de 7 milliards de paramètres exigeait des ressources GPU sérieuses. Maintenant, on peut faire du fine-tuning sur un seul GPU grand public en quelques heures et partager le minuscule fichier d'adaptateur. C'est la raison pour laquelle il y a des milliers de modèles spécialisés sur HuggingFace.
Fonction de perte
Fonction objectif
Mesure à quel point les prédictions sont fausses. Pour les LLM : la perte d'entropie croisée = à quel point le modèle est surpris par le vrai prochain token.
Pourquoi c'est important : La boussole de l'entraînement. Comprendre la perte aide à interpréter les courbes d'entraînement et à diagnostiquer les problèmes.
Outils
Une bibliothèque open-source en C/C++ pour exécuter l'inférence LLM sur du matériel grand public, créée par Georgi Gerganov. llama.cpp effectue l'inférence quantifiée sans nécessiter CUDA, PyTorch ou Python — il fonctionne sur CPU, Apple Silicon et GPU grand public. C'est le premier outil à avoir rendu l'exécution locale de grands modèles de langage accessible aux développeurs ordinaires et aux passionnés.
Pourquoi c’est important : llama.cpp a lancé la révolution de l'IA locale. Avant lui, exécuter un modèle de langage nécessitait des GPU NVIDIA coûteux et des configurations Python complexes. llama.cpp a montré que des modèles quantifiés pouvaient tourner sur un MacBook ou même un Raspberry Pi avec une qualité acceptable. Il a engendré tout un écosystème (Ollama, LM Studio, kobold.cpp) et a fait de l'« IA auto-hébergée » une option réelle.
Outils
Un framework open-source populaire pour construire des applications avec des modèles de langage. LangChain fournit des abstractions pour les patterns courants : connecter des LLM à des sources de données (RAG), construire des chaînes d'appels LLM en plusieurs étapes, gérer la mémoire conversationnelle, utiliser des outils et orchestrer des agents. Il supporte plusieurs fournisseurs (Anthropic, OpenAI, modèles locaux) via une interface unifiée.
Pourquoi c’est important : LangChain est le framework d'application LLM le plus utilisé, ce qui signifie que tu le rencontreras dans des tutoriels, des offres d'emploi et des codebases existantes. Il est aussi controversé — les critiques arguent qu'il ajoute une abstraction inutile par-dessus de simples appels API. Comprendre ce que LangChain fait (et quand l'utiliser vs. des appels API directs) t'aide à prendre des décisions architecturales éclairées.
Logits
Scores bruts, sorties pré-softmax
Fondamentaux
Les scores bruts et non normalisés qu'un modèle produit avant qu'ils soient convertis en probabilités par la fonction softmax. Pour un modèle de langage, les logits sont un vecteur avec une valeur par token dans le vocabulaire — des valeurs plus élevées indiquent les tokens que le modèle considère plus probables. Les logits sont la sortie la plus informative d'un modèle, contenant plus d'information que la distribution de probabilité finale.
Pourquoi c’est important : Comprendre les logits t'aide à comprendre comment les modèles « pensent ». La température, le top-p et le top-k opèrent tous sur les logits. Le classifier-free guidance en génération d'images manipule les logits. Le biais de logit (ajouter des offsets à des tokens spécifiques) te permet d'orienter le comportement du modèle. Si tu construis des applications IA au-delà du chat basique, tu devras éventuellement travailler directement avec les logits.
Planning du taux d'apprentissage
LR Schedule, warmup, cosine annealing
Entraînement
Une stratégie pour changer le taux d'apprentissage pendant l'entraînement plutôt que de le garder constant. La plupart des entraînements modernes utilisent un warmup (augmenter graduellement de quasi-zéro au pic) suivi d'une décroissance (diminuer graduellement vers zéro). Le cosine annealing est le planning de décroissance le plus courant. Le taux d'apprentissage contrôle la taille de chaque étape de mise à jour du gradient — c'est sans doute l'hyperparamètre le plus important de l'entraînement.
Pourquoi c’est important : Trouver le bon planning de taux d'apprentissage peut faire ou défaire un entraînement. Trop haut et le modèle diverge (pics de perte, entraînement échoué). Trop bas et il s'entraîne trop lentement ou se bloque. Le planning interagit avec la taille du lot, la taille du modèle et les données — il n'y a pas de réglage universel. Comprendre les plannings de taux d'apprentissage t'aide à interpréter les courbes d'entraînement et à diagnostiquer les problèmes d'entraînement.
Lambda Labs
Lambda, Lambda Cloud
Compagnies
Un fournisseur de cloud GPU spécialisé dans les charges de travail IA et machine learning. Lambda offre des instances GPU NVIDIA à la demande et réservées (A100, H100, H200) pour l'entraînement et l'inférence à des prix compétitifs ou inférieurs à AWS, GCP et Azure. Ils vendent aussi des postes de travail et serveurs GPU. Fondée en 2012, Lambda est devenue un fournisseur de référence pour les chercheurs et startups en IA.
Pourquoi c'est important : Lambda représente la couche cloud GPU qui rend le développement IA possible pour les équipes qui ne peuvent pas se permettre de construire leurs propres centres de données mais qui ont besoin de plus de contrôle et de meilleurs prix que les fournisseurs de cloud hyperscalers. Pour les startups qui entraînent des modèles, la disponibilité et les prix GPU de Lambda peuvent faire la différence entre un entraînement faisable et infaisable.
M
Modèle du monde
Modèle interne du monde, simulateur appris
Modèles
Un modèle qui construit une représentation interne du fonctionnement du monde — pas seulement des corrélations statistiques mais des relations causales, des lois physiques et du raisonnement spatial. Le débat sur la question de savoir si les LLM possèdent des modèles du monde est l'un des plus controversés en IA : comprennent-ils vraiment que les objets tombent quand on les lâche, ou savent-ils simplement que « tombe » suit souvent « lâché » dans le texte?
Pourquoi c'est important : Les modèles du monde sont au cœur de la question la plus importante en IA : la compréhension nécessite-t-elle plus que de la reconnaissance de patterns? Si les LLM construisent de véritables modèles du monde, ils sont plus proches de la compréhension qu'on ne le pensait. Si ce n'est pas le cas, il y a une lacune fondamentale de capacité que la mise à l'échelle seule ne comblera pas. La réponse a des implications massives pour la sécurité de l'IA, les capacités et le chemin vers une intelligence plus générale.
Modèle
Modèle IA, modèle ML
Fondamentaux
Un système mathématique entraîné qui reçoit des entrées et produit des sorties en se basant sur des motifs appris à partir des données. En intelligence artificielle, le terme « modèle » désigne le terme générique pour l'élément que vous utilisez réellement — qu'il s'agisse de GPT-4 qui génère du texte, de Stable Diffusion qui génère des images ou de Whisper qui transcrit la parole. Un modèle est défini par son architecture (la manière dont il est structuré), ses paramètres (ce qu'il a appris) et ses données d'entraînement (de quoi il a appris). Lorsqu'on dit « quel modèle devrais-je utiliser? », on fait référence à cela.
Pourquoi c’est important : Le mot « model » est le plus utilisé dans l'intelligence artificielle, et il peut avoir des significations différentes selon les contextes. Un « model » peut désigner l'architecture (Transformer), une instance entraînée spécifique (Claude Opus 4.6), un fichier sur disque (un fichier .gguf) ou un point de terminaison API. Comprendre ce qu'est réellement un modèle — et ce qu'il n'est pas — constitue la base de tout le reste.
Fondamentaux
Le domaine vaste de l'informatique où les systèmes apprennent des modèles à partir de données plutôt que de suivre des règles explicites. Au lieu de programmer un ordinateur pour reconnaître un chat en listant des caractéristiques (quatre pattes, oreilles pointues, moustaches), on lui montre des milliers de photos de chats et on lui laisse découvrir le modèle par lui-même. L'apprentissage automatique englobe tout, de la régression linéaire simple aux réseaux de neurones profonds qui alimentent l'IA d'aujourd'hui — l'apprentissage supervisé (exemples étiquetés), l'apprentissage non supervisé (découverte de structures) et l'apprentissage par renforcement (essai-erreur).
Pourquoi c’est important : L'apprentissage automatique est le fondement de tous les outils que nous appelons « IA » aujourd'hui. Chaque modèle de langage de grande envergure, chaque générateur d'images, chaque algorithme de recommandation, chaque filtre anti-spam — c'est tout l'apprentissage automatique. Comprendre l'apprentissage automatique en tant que discipline plus large vous permet de voir où s'applique l'apprentissage profond, où les méthodes classiques restent plus efficaces, et pourquoi l'« IA » n'est en réalité qu'« l'apprentissage automatique qui a vraiment bien fonctionné ».
Mémoire
Mémoire IA, contexte persistant
Utiliser l’AI
Les mécanismes qui permettent aux modèles d'IA de retenir et de rappeler des informations au-delà d'une seule conversation. Cela inclut la mémoire en contexte (utilisation de la fenêtre de contexte), la mémoire externe (RAG, bases de données vectorielles), la mémoire de conversation persistante (se souvenir des préférences de l'utilisateur entre les sessions) et la mémoire de travail (maintien de l'état pendant des tâches d'agent en plusieurs étapes). La mémoire est ce qui fait que l'IA ressemble à un collaborateur plutôt qu'à un outil sans état.
Pourquoi c’est important : Sans mémoire, chaque conversation IA repart de zéro. Vous répétez vos préférences, ré-expliquez votre base de code, re-décrivez votre projet. La mémoire est ce qui transforme un agent conversationnel en assistant — et c'est l'un des problèmes les plus difficiles à bien résoudre, équilibrant pertinence, vie privée, obsolescence et coûts de stockage.
Moonshot AI
Kimi, modèles à contexte ultra-long
Compagnies
Entreprise chinoise d'IA qui a fait sensation en lançant Kimi, un agent conversationnel doté d'une fenêtre de contexte de 2 millions de jetons. Fondée par Yang Zhilin, ancien chercheur derrière des innovations clés en modélisation de longs contextes.
Pourquoi c’est important : Moonshot AI a forcé toute l'industrie à prendre la longueur du contexte au sérieux. Avant Kimi, la prise en charge de longs contextes était un atout secondaire ; après que Kimi soit devenu viral en Chine, tous les grands laboratoires se sont précipités pour étendre leurs fenêtres de contexte. Le pari de Yang Zhilin — que les utilisateurs changeraient fondamentalement leur façon d'interagir avec l'IA quand on leur donnerait assez de contexte — a été validé par la croissance explosive de Kimi, et les techniques développées par Moonshot pour l'inférence efficace de longues séquences influencent la façon dont la prochaine génération de modèles gère les documents, les bases de code et le raisonnement complexe en plusieurs étapes.
Meta AI
Llama, FAIR, PyTorch
Compagnies
La division de recherche en IA de Meta, qui abrite FAIR (Fundamental AI Research). Responsable de la famille de modèles à poids ouverts Llama et de PyTorch, le cadriciel d'apprentissage profond utilisé par la majeure partie de l'industrie de l'IA.
Pourquoi c’est important : Meta AI a fondamentalement changé l'économie de l'IA en prouvant que des modèles de classe frontière pouvaient être publiés en poids ouverts. Llama et ses dérivés alimentent des milliers d'applications, de startups et de projets de recherche qui n'auraient jamais eu accès à des modèles de ce calibre. PyTorch sous-tend la majorité des systèmes de recherche et de production en IA dans le monde. Et avec plus de 3 milliards d'utilisateurs à travers ses applications, Meta dispose d'une distribution qu'aucun autre laboratoire d'IA ne peut égaler — quand ils lancent une fonctionnalité IA, elle atteint un tiers de l'humanité du jour au lendemain.
Mistral AI
Mistral, Mixtral, Codestral, Le Chat
Compagnies
Puissance européenne de l'IA fondée par d'anciens chercheurs de DeepMind et Meta. Reconnue pour ses performances au-delà de ses moyens grâce à des modèles efficaces, et pour son engagement envers la distribution en poids ouverts parallèlement à ses offres commerciales.
Pourquoi c’est important : Mistral a prouvé qu'il n'est pas nécessaire de disposer de budgets d'hyperscalers américains pour construire des modèles d'IA de pointe. Leurs architectures efficaces — en particulier leurs travaux pionniers sur le mélange d'experts épars — ont influencé l'approche de toute l'industrie en matière de conception de modèles, et leurs publications en poids ouverts ont donné aux développeurs du monde entier accès à des modèles de haute qualité sans dépendance à une API. En tant que première entreprise européenne d'IA à atteindre une véritable compétition de pointe, Mistral revêt également une importance stratégique : son succès (ou son échec) déterminera si l'Europe peut être un acteur de l'IA, ou simplement un régulateur.
MiniMax
Modèles MiniMax, Hailuo AI, génération vidéo
Compagnies
Entreprise d'IA chinoise développant des modèles à grande échelle en texte, voix et vidéo. Connue pour sa plateforme grand public Hailuo et ses modèles multimodaux de plus en plus compétitifs.
Pourquoi c’est important : MiniMax s'est imposée comme l'une des entreprises d'IA les plus polyvalentes en Chine, développant des modèles compétitifs en texte, voix et vidéo à partir d'une pile intégrée unique. Leur plateforme Hailuo AI a rendu la génération vidéo par IA de haute qualité accessible à un public mondial et gratuitement, démontrant que les laboratoires d'IA chinois peuvent construire des produits grand public avec une portée internationale véritable — et pas seulement des API pour entreprises ou des articles de recherche.
MCP
Protocole de contexte de modèle
Outils
Un protocole ouvert (créé par Anthropic) qui standardise la façon dont les modèles d'IA se connectent aux outils et sources de données externes. Pensez-y comme l'USB-C de l'IA — une interface standard unique au lieu d'intégrations sur mesure pour chaque outil. Les serveurs MCP exposent des capacités; les clients MCP (comme Claude) les consomment.
Pourquoi c’est important : Avant MCP, chaque intégration IA-outil était sur mesure. MCP signifie qu'un outil construit une fois fonctionne avec tout client compatible. Il est déjà pris en charge par Claude, Cursor et d'autres. C'est ainsi que l'IA passe du chatbot à un véritable assistant.
Modèles
Une architecture où le modèle contient plusieurs sous-réseaux « experts », mais n'en active que quelques-uns pour chaque entrée. Un réseau routeur décide quels experts sont pertinents pour un token donné. Cela signifie qu'un modèle peut avoir plus de 100 milliards de paramètres au total mais n'en utiliser que 20 milliards pour chaque passage.
Pourquoi c’est important : Le MoE est la façon dont des modèles comme Mixtral et (selon toute vraisemblance) GPT-4 obtiennent la qualité d'un énorme modèle avec la vitesse d'un plus petit. Le compromis est une utilisation mémoire plus élevée (tous les experts doivent être chargés) même si le calcul est moins coûteux.
Fondamentaux
Un modèle capable de comprendre et/ou de générer plusieurs types de données : texte, images, audio, vidéo, code. Claude peut lire des images et du texte; certains modèles peuvent aussi produire des images ou de la parole. « Multimodal » contraste avec les modèles « unimodaux » qui ne gèrent qu'un seul type.
Pourquoi c’est important : Les tâches du monde réel sont multimodales. Vous voulez montrer une capture d'écran à une IA et demander « qu'est-ce qui cloche ici? » ou lui donner un diagramme et dire « implémente ça ». Les modèles multimodaux rendent cela possible.
Mamba
SSM sélectif
Modèle d'espace d'états sélectif de Gu & Dao. Scaling linéaire dans la longueur de séquence vs quadratique pour le Transformer.
Pourquoi c'est important : Le défi le plus crédible à la domination du Transformer. Les architectures hybrides (Jamba, Zamba) sont déjà en production.
Rétro-ingénierie de ce qui se passe à l'intérieur des réseaux de neurones au niveau des neurones, circuits et features.
Pourquoi c'est important : Centrale pour la sécurité de l'IA. Domaine de recherche clé chez Anthropic. Les chercheurs ont trouvé des circuits spécifiques à l'intérieur des Transformers.
Génération d'images IA connue pour son raffinement esthétique. Fonctionne via Discord et le web. Petite équipe, rentable, axée sur la qualité.
Pourquoi c'est important : Le plus populaire pour l'usage créatif/artistique. Prouve que la curation et l'UX comptent autant que l'architecture.
Service de modèles
vLLM, TGI, TensorRT-LLM, serveur d'inférence
L'infrastructure et les logiciels qui font tourner des modèles d'IA entraînés en production, gérant les requêtes entrantes, administrant la mémoire GPU, regroupant les requêtes pour l'efficacité et retournant les réponses. Les frameworks de service de modèles comme vLLM, TGI (Text Generation Inference) et TensorRT-LLM gèrent l'ingénierie complexe nécessaire pour rendre l'inférence LLM rapide et rentable à l'échelle.
Pourquoi c'est important : Le fossé entre « j'ai un modèle » et « je peux servir 10 000 utilisateurs simultanément » est énorme. Les frameworks de service de modèles résolvent la gestion de la mémoire GPU, l'ordonnancement des requêtes, l'optimisation du cache KV et le batching continu — des problèmes difficiles à résoudre à partir de zéro. Choisir la bonne pile de service est une des décisions les plus impactantes en IA de production.
Effondrement de modèle
Boucle de rétroaction des données
Entraînement
La dégradation qui se produit quand des modèles d'IA sont entraînés sur des données générées par des modèles d'IA précédents, créant une boucle de rétroaction où les erreurs et les biais s'accumulent à travers les générations. Chaque génération perd un peu de diversité et amplifie certains artefacts de la précédente, produisant finalement des modèles qui génèrent des sorties répétitives, génériques ou distordues.
Pourquoi c’est important : L'effondrement de modèle est la bombe à retardement de l'ère du contenu généré par IA. À mesure qu'internet se remplit de texte généré par IA (estimé à 10–50 % du nouveau contenu web), les futurs modèles entraînés sur des scrapes web ingéreront inévitablement des sorties d'IA. Si ça n'est pas géré avec soin, la qualité des modèles pourrait plafonner ou se dégrader. C'est pourquoi la curation des données et le suivi de provenance deviennent une infrastructure critique.
Systèmes multi-agents
Multi-agent, essaim d'agents
Utiliser l'IA
Des architectures où plusieurs agents IA collaborent, débattent ou se spécialisent pour résoudre des problèmes qu'un seul agent ne peut pas gérer seul. Chaque agent peut avoir un rôle différent (chercheur, codeur, réviseur), des outils différents ou des modèles différents. Ils communiquent par des messages structurés, une mémoire partagée ou des transferts directs.
Pourquoi c’est important : Les systèmes multi-agents sont le paradigme émergent pour les tâches IA complexes. Un seul appel LLM traite une question. Un agent traite une tâche en plusieurs étapes. Un système multi-agents traite des tâches qui nécessitent différentes expertises, un travail en parallèle ou une assurance qualité par la révision. À mesure que l'IA passe des chatbots aux workflows autonomes, les architectures multi-agents deviennent le pattern de mise à l'échelle naturel.
Entraînement en précision mixte
Aussi appelé : FP16, BF16, demi-précision
Entraînement
Entraîner des réseaux de neurones en utilisant des formats numériques de précision réduite (16 bits au lieu de 32 bits) pour la plupart des calculs tout en gardant les opérations critiques en pleine précision. Ça double la capacité mémoire effective et la vitesse de calcul des GPU avec un impact minimal sur la qualité du modèle. BF16 (bfloat16) est le standard pour l'entraînement de LLM; FP16 est utilisé pour l'inférence.
Pourquoi c’est important : La précision mixte est la raison pour laquelle on peut entraîner des modèles aussi gros qu'on le fait. Un modèle de 70B paramètres en FP32 nécessiterait 280 Go juste pour les poids — impossible sur un seul GPU. En BF16, il faut 140 Go, ce qui tient sur quelques GPU. La précision mixte a effectivement doublé la capacité de calcul de l'industrie de l'IA gratuitement, juste en utilisant un format numérique plus intelligent.
Modélisation par langage masqué
MLM, Masked LM, tâche de Cloze
Entraînement
Un objectif d'entraînement auto-supervisé où des tokens aléatoires dans l'entrée sont remplacés par un token [MASK], et le modèle doit prédire les tokens originaux à partir du contexte. BERT a popularisé le MLM : masquer 15% des tokens, utiliser l'attention bidirectionnelle pour regarder le contexte à gauche et à droite, et prédire les mots masqués. Cela crée des modèles puissants de compréhension du texte (par opposition aux modèles de génération de texte).
Pourquoi c’est important : Le MLM est l'objectif d'entraînement qui a créé BERT et toute la famille de modèles encodeurs qui alimentent encore la plupart des systèmes de recherche, classification et embedding en production. Comprendre MLM vs. modélisation causale du langage (prédiction du prochain token) explique la division fondamentale entre les modèles de compréhension (BERT) et les modèles de génération (GPT) — et pourquoi chacun excelle dans différentes tâches.
Traduction automatique
MT, Traduction neuronale, NMT
Utiliser l'AI
Traduire automatiquement du texte d'une langue à une autre. La traduction automatique neuronale (NMT) moderne utilise des Transformers encodeur-décodeur entraînés sur des corpus parallèles (textes et leurs traductions). Google Translate, DeepL et la traduction par LLM utilisent tous des variantes de cette approche. La qualité s'est améliorée de façon spectaculaire — pour les paires de langues courantes, la MT se rapproche de la traduction humaine professionnelle pour le contenu courant.
Pourquoi c'est important : La traduction automatique brise les barrières linguistiques à grande échelle. Elle permet le commerce mondial, la recherche multilingue, la communication en temps réel et l'accès à l'information à travers les langues. Pour l'IA spécifiquement, la MT est la façon dont les modèles entraînés principalement en anglais peuvent servir des utilisateurs dans plus de 100 langues — et c'est pourquoi l'efficacité des tokenizers multilingues compte pour le coût.
Génération de musique
Musique IA, Text-to-Music
Utiliser l'AI
Créer de la musique à partir de descriptions textuelles, de mélodies ou d'autres entrées audio en utilisant des modèles IA. « Un morceau électronique entraînant avec une mélodie de synthé accrocheuse, 120 BPM » produit une composition musicale complète. Suno, Udio, MusicLM (Google) et Stable Audio sont les modèles leaders. Les systèmes actuels génèrent des voix, des instrumentaux et des arrangements complets dans des styles et genres divers.
Pourquoi c'est important : La génération de musique est l'équivalent audio de la génération d'images — elle rend la création musicale accessible à tout le monde, pas seulement aux musiciens formés. Les créateurs de contenu ont besoin de musique de fond, les développeurs de jeux ont besoin de bandes sonores, les annonceurs ont besoin de jingles. La musique IA remplit ces besoins pour une fraction du coût et du temps nécessaires pour engager des musiciens. Mais ça soulève aussi les mêmes questions de droits d'auteur et d'authenticité que la génération d'images.
Registre de modèles
Model Store, Catalogue de modèles
Infrastructure
Un système centralisé pour versionner, suivre et gérer les modèles de machine learning entraînés tout au long de leur cycle de vie. Comme un registre de paquets (npm, PyPI) mais pour les modèles ML : chaque version du modèle est stockée avec ses métadonnées (données d'entraînement, hyperparamètres, métriques de performance, lignage), rendant possible la reproduction des résultats, la comparaison des versions et le déploiement de modèles spécifiques en production.
Pourquoi c'est important : Sans registre de modèles, le développement ML devient le chaos : quelle version du modèle est en production? Sur quelles données a-t-il été entraîné? Quand l'a-t-on mis à jour pour la dernière fois? Qui l'a entraîné? Un registre de modèles répond à toutes ces questions et fournit la fondation pour un déploiement ML reproductible, auditable et fiable. C'est de l'infrastructure essentielle pour toute équipe qui fait tourner des modèles en production.
Fondamentaux
L'opération mathématique fondamentale qui sous-tend tous les réseaux de neurones. Multiplier une matrice de poids par un vecteur (ou une matrice) d'entrée produit un vecteur de sortie. Chaque couche linéaire, chaque calcul d'attention, et chaque lookup d'embedding est ultimement une multiplication matricielle. La performance du matériel IA (GPU, TPU) se mesure à la vitesse à laquelle il peut faire des multiplications matricielles.
Pourquoi c'est important : Comprendre que les réseaux de neurones sont juste des séquences de multiplications matricielles (avec des non-linéarités entre les deux) démystifie tout le domaine. Ça explique pourquoi les GPU sont essentiels (ce sont des machines de multiplication matricielle parallèle), pourquoi la taille du modèle se mesure en paramètres (le nombre de valeurs dans les matrices de poids), et pourquoi les FLOP sont l'unité de calcul (ça compte les opérations multiplication-addition dans ces multiplications matricielles).
N
Neurone
Neurone artificiel, perceptron, nœud
Fondamentaux
L'unité de calcul de base d'un réseau de neurones. Un neurone artificiel reçoit des entrées, multiplie chacune par un poids, les additionne, ajoute un biais, et passe le résultat à travers une fonction d'activation pour produire une sortie. Des milliers à des milliards de ces neurones, organisés en couches et connectés par des poids appris, forment les réseaux de neurones qui propulsent toute l'IA moderne.
Pourquoi c'est important : Les neurones sont les atomes de l'apprentissage profond. Comprendre un seul neurone — somme pondérée plus activation — rend le reste de l'architecture des réseaux de neurones intuitif. Une couche est un groupe de neurones. Un réseau est un empilement de couches. L'entraînement consiste à ajuster les poids. Tout le reste, c'est des détails (importants, mais des détails).
Fondamentaux
La branche de l'IA axée sur la capacité des machines à comprendre, interpréter et générer un langage humain. Le NLP englobe tout, des traitements de base du texte (tokenisation, racinisation, balisage des parties du discours) aux tâches complexes comme l'analyse de sentiment, la traduction automatique, la synthèse de résumés et la réponse aux questions. Avant les Transformers, le NLP était un ensemble disparate de techniques spécialisées. Aujourd'hui, les grands modèles de langage (LLMs) ont unifié la plupart des aspects du NLP sous un seul paradigme — mais les fondements du domaine restent essentiels pour comprendre comment et pourquoi ces modèles fonctionnent.
Pourquoi c’est important : L'IA est la raison pour laquelle vous pouvez parler à l'IA en anglais simple et obtenir des réponses utiles. Tout chatbot, tout moteur de recherche, tout service de traduction, tout outil d'écriture IA est basé sur le NLP. Même si vous ne construisez jamais un système NLP depuis zéro, comprendre les fondamentaux — tokenization, attention, embeddings, contexte — vous rend plus efficace avec chaque outil IA qui traite le texte.
NVIDIA
GPU, CUDA, H100/H200, NeMo
Compagnies
L'entreprise dont les GPU alimentent pratiquement tout l'entraînement d'IA et la majeure partie de l'inférence à l'échelle mondiale. Ce qui a commencé comme un fabricant de cartes graphiques est devenu le fournisseur de matériel le plus critique de l'industrie de l'IA, faisant brièvement de NVIDIA l'entreprise la plus valorisée au monde.
Pourquoi c’est important : NVIDIA est l'entreprise sans laquelle la révolution de l'IA n'aurait tout simplement pas lieu — leurs GPU et leur écosystème logiciel CUDA sont les fondations sur lesquelles pratiquement tous les grands modèles d'IA ont été entraînés. La combinaison de matériel d'IA spécialisé, d'un rempart logiciel forgé sur une décennie et du contrôle du tissu réseau qui interconnecte les GPU leur a conféré une position quasi monopolistique dans la chaîne d'approvisionnement la plus critique du 21e siècle. Quand les gouvernements, les entreprises et les laboratoires de recherche se disputent la puissance de calcul IA, c'est pour du matériel NVIDIA qu'ils se battent, et ce simple fait a transformé l'ancien fabricant de cartes graphiques de Jensen Huang en l'entreprise technologique la plus stratégiquement importante de la planète.
Fondamentaux
Un système informatique vaguement inspiré du cerveau biologique, composé de couches de « neurones » interconnectés (des fonctions mathématiques) qui apprennent des patterns à partir de données. L'information traverse les couches en étant progressivement transformée jusqu'à ce que le réseau produise une sortie. Tous les modèles d'IA modernes sont des réseaux de neurones d'un type ou d'un autre.
Pourquoi c’est important : Les réseaux de neurones sont le « comment » derrière toute l'IA. Comprendre qu'il s'agit de mathématiques (ni de magie, ni de cerveaux) aide à démystifier ce que l'IA peut et ne peut pas faire. Ce sont des détecteurs de patterns — extraordinairement puissants, certes, mais des détecteurs de patterns tout de même.
Normalisation
LayerNorm, RMSNorm, BatchNorm
Des techniques qui stabilisent l'entraînement des réseaux de neurones en normalisant les valeurs circulant dans le réseau pour avoir une échelle cohérente. Layer Normalization (LayerNorm) normalise à travers les caractéristiques au sein de chaque exemple. RMSNorm est une variante simplifiée. Batch Normalization (BatchNorm) normalise à travers le lot. Chaque Transformer utilise une forme de normalisation entre les couches.
Pourquoi c'est important : Sans normalisation, les réseaux profonds sont extrêmement difficiles à entraîner — les activations peuvent exploser ou s'évanouir à travers les couches, rendant la descente de gradient instable. La normalisation est une de ces techniques peu glamour qui est absolument essentielle : retire-la de n'importe quelle architecture moderne et l'entraînement s'effondre.
Reconnaissance d'entités nommées
NER, Extraction d'entités
Utiliser l'AI
Identifier et catégoriser les entités nommées dans un texte — personnes, organisations, lieux, dates, montants monétaires et autres noms propres. Dans « Apple a annoncé un investissement de 3 G$ à Munich mardi », le NER identifie Apple (Organisation), 3 G$ (Argent), Munich (Lieu) et mardi (Date). C'est une tâche NLP fondamentale utilisée dans l'extraction d'information, la recherche et la construction de graphes de connaissances.
Pourquoi c'est important : Le NER est la colonne vertébrale de l'extraction d'information structurée à partir de texte non structuré. Chaque moteur de recherche, agrégateur de nouvelles et système de renseignement utilise le NER pour comprendre de quoi parle un document. C'est aussi la première étape dans la construction de graphes de connaissances à partir de texte — tu ne peux pas construire de relations entre des entités que tu n'as pas identifiées.
Prompt négatif
Conditionnement négatif
Utiliser l'AI
Une description textuelle de ce que tu ne veux pas dans une image générée, utilisée à côté du prompt principal. Prompt : « un beau paysage. » Prompt négatif : « flou, basse qualité, texte, filigrane, personnes. » Le modèle s'éloigne activement des concepts du prompt négatif pendant la génération. Les prompts négatifs sont principalement utilisés avec Stable Diffusion et d'autres modèles de génération d'images ouverts.
Pourquoi c'est important : Les prompts négatifs sont l'un des outils les plus efficaces pour améliorer la qualité de la génération d'images. Sans eux, les modèles ont tendance à produire des artefacts (zones floues, doigts en trop, filigranes de texte) parce que ceux-ci apparaissent fréquemment dans les données d'entraînement. Un prompt négatif bien construit élimine les modes d'échec courants et te donne plus de contrôle sur la sortie sans changer le prompt positif.
O
ONNX
Open Neural Network Exchange
Infrastructure
Un format ouvert pour représenter les modèles d'apprentissage automatique qui permet l'interopérabilité entre frameworks. Un modèle entraîné dans PyTorch peut être exporté en ONNX puis exécuté avec ONNX Runtime, TensorRT ou d'autres moteurs d'inférence optimisés pour du matériel spécifique. ONNX agit comme un langage commun entre le monde de l'entraînement (PyTorch, TensorFlow) et le monde du déploiement (runtimes optimisés).
Pourquoi c'est important : ONNX résout un vrai problème de production : tu entraînes dans PyTorch (le standard de recherche) mais tu déploies sur du matériel qui tourne mieux avec un runtime différent. Convertir en ONNX te permet d'utiliser des moteurs d'inférence optimisés sans réécrire ton modèle. C'est particulièrement important pour le déploiement en périphérie où tu as besoin de performance maximale sur du matériel limité.
Ouvert vs. Fermé
Open source vs. propriétaire, débat sur les poids ouverts
Fondamentaux
Le débat en cours sur la question de savoir si les modèles d'IA devraient être publiés ouvertement (poids accessibles au public, comme Llama et Mistral) ou rester propriétaires (disponibles uniquement via API, comme Claude et GPT). Les partisans de l'ouverture défendent la transparence, la compétition et la démocratisation. Les partisans du fermé défendent la sécurité, le déploiement responsable et la prévention du mésusage. La réalité est un spectre : les modèles véritablement « open source » (avec données d'entraînement et code) sont rares; la plupart des modèles « ouverts » sont à poids ouverts.
Pourquoi c'est important : Ce débat façonne l'avenir de l'IA. Si le fermé l'emporte, quelques entreprises contrôlent l'accès à la technologie la plus puissante du siècle. Si l'ouvert l'emporte, l'IA puissante est accessible à tous — y compris ceux qui en abuseraient. La plupart des praticiens utilisent les deux : des API propriétaires pour la production (fiabilité, support) et des modèles ouverts pour l'expérimentation, la confidentialité et le contrôle des coûts. Comprendre les compromis t'aide à choisir.
Optimisation
Optimisation de modèle, optimisation d'inférence
Entraînement
L'ensemble large de techniques utilisées pour rendre les modèles d'IA plus rapides, plus petits, moins chers ou plus précis. Cela inclut les optimisations d'entraînement (précision mixte, gradient checkpointing, parallélisme de données), les optimisations d'inférence (quantification, élagage, distillation, décodage spéculatif) et les optimisations de service (traitement par lots, mise en cache, équilibrage de charge). L'optimisation est la raison pour laquelle on peut faire tourner un modèle de 14 milliards de paramètres sur un portable.
Pourquoi c’est important : La capacité brute ne signifie rien si on ne peut pas se permettre de la faire tourner. L'optimisation est la différence entre une démonstration de recherche et un produit en production. C'est pourquoi les modèles à poids ouverts peuvent rivaliser avec les fournisseurs d'API, pourquoi l'IA mobile existe, et pourquoi les coûts d'inférence continuent de baisser.
OpenAI
GPT, ChatGPT, DALL-E, Sora
Compagnies
L'entreprise derrière ChatGPT et la série de modèles GPT. À l'origine un laboratoire de recherche à but non lucratif, OpenAI est devenue le visage public de la révolution de l'IA lors du lancement de ChatGPT en novembre 2022.
Pourquoi c’est important : OpenAI a fait plus que toute autre organisation pour faire passer l'IA du laboratoire de recherche à la conscience collective. ChatGPT a été le moment iPhone de l'IA générative — le produit qui a fait comprendre viscéralement à des centaines de millions de personnes ce que les grands modèles de langage pouvaient accomplir. Leur API a créé la couche d'infrastructure sur laquelle des milliers de startups en IA ont été bâties, et la série GPT a établi la mise à l'échelle comme paradigme dominant de la recherche en IA pendant des années. Même les controverses d'OpenAI — la crise de gouvernance, la conversion du but non lucratif vers le lucratif, les départs de chercheurs axés sur la sécurité — ont façonné le débat plus large sur la manière dont les entreprises d'IA devraient être structurées et gouvernées.
Poids ouverts
Open source (en contexte IA)
Sécurité
Quand une entreprise publie les paramètres entraînés d'un modèle pour que quiconque puisse le télécharger et l'exécuter. « Open weights » est plus exact que « open source » parce que la plupart des modèles publiés n'incluent pas les données d'entraînement ni le code d'entraînement — on obtient le modèle fini mais pas la recette. Llama, Mistral et Qwen sont des modèles open-weights.
Pourquoi c’est important : Les open weights signifient que vous pouvez exécuter l'IA sur votre propre matériel en toute confidentialité — pas d'appels API, pas de données qui quittent votre réseau. Le compromis, c'est qu'il faut les ressources GPU pour les faire tourner et que vous êtes responsable de la sécurité.
Entraînement
Quand un modèle mémorise ses données d'entraînement trop bien et perd la capacité de généraliser à de nouvelles entrées. Comme un étudiant qui mémorise les réponses d'examens pratiques mais ne peut pas résoudre de nouveaux problèmes. Le modèle performe très bien sur les données d'entraînement mais mal sur tout ce qu'il n'a pas vu auparavant.
Pourquoi c’est important : Le surapprentissage est le mode de défaillance le plus courant en entraînement de modèles. C'est pourquoi l'évaluation utilise des ensembles de test séparés, et pourquoi entraîner trop longtemps (trop d'époques) peut en fait rendre un modèle moins bon.
Outils
Un outil convivial pour exécuter des modèles de langage localement avec une seule commande. Ollama encapsule llama.cpp dans une expérience similaire à Docker : ollama run llama3 télécharge et exécute Llama 3, sélectionnant automatiquement la bonne quantification pour ton matériel. Il gère les téléchargements de modèles, fournit un serveur API et détecte le matériel.
Pourquoi c’est important : Ollama est à l'IA locale ce que Docker est à la conteneurisation : il a éliminé la friction. Avant Ollama, exécuter un modèle local signifiait choisir des niveaux de quantification, télécharger des fichiers GGUF, configurer les flags de llama.cpp et gérer le déchargement GPU. Ollama gère tout ça automatiquement. C'est le chemin le plus rapide entre « je veux essayer l'IA locale » et le faire réellement.
Détection d'objets
YOLO, Détection par boîte englobante
Utiliser l'AI
Identifier et localiser des objets dans des images ou vidéos en dessinant des boîtes englobantes autour d'eux et en classifiant le contenu de chaque boîte. « Il y a une voiture à la position (x1,y1,x2,y2) et une personne à (x3,y3,x4,y4). » Contrairement à la classification d'images (qui dit ce qu'il y a dans l'image), la détection d'objets dit ce qu'il y a dans l'image et où — permettant le comptage, le suivi et le raisonnement spatial.
Pourquoi c'est important : La détection d'objets est la technologie derrière les voitures autonomes (détecter les piétons, véhicules, panneaux), les caméras de sécurité (détection de personnes), l'analytique retail (compter les clients), le contrôle qualité en manufacture (détecter les défauts), et la réalité augmentée (placer des objets virtuels par rapport aux objets réels). C'est l'une des capacités de vision par ordinateur les plus déployées commercialement.
OCR
Reconnaissance optique de caractères, Reconnaissance de texte
Utiliser l'AI
Extraire du texte à partir d'images — photographies de documents, captures d'écran, panneaux, notes manuscrites, ou toute image contenant du texte. L'OCR moderne combine la détection de texte (trouver où le texte apparaît dans l'image) avec la reconnaissance de texte (lire ce que dit le texte). L'OCR par deep learning gère le texte courbé, les langues multiples, les polices variées et la mauvaise qualité d'image bien mieux que les anciennes approches à base de règles.
Pourquoi c'est important : L'OCR numérise le monde physique. Scanner les reçus pour le suivi des dépenses, lire des documents pour l'archivage, extraire des données de formulaires, traduire des panneaux en temps réel, et rendre les PDF basés sur des images consultables dépendent tous de l'OCR. Combiné avec les LLM, l'OCR permet la compréhension sophistiquée de documents — pas juste lire du texte mais comprendre les factures, contrats et rapports.
P
Paramètres
Poids, paramètres de modèle
Fondamentaux
Les valeurs internes apprises par un réseau de neurones lors de l'entraînement — essentiellement la « connaissance » du modèle encodée sous forme de nombres. Lorsqu'on dit qu'un modèle possède « 7 milliards de paramètres », cela signifie que 7 milliards de valeurs numériques individuelles ont été ajustées lors de l'entraînement afin de capturer les motifs présents dans les données. Un plus grand nombre de paramètres implique généralement une plus grande capacité à apprendre des motifs complexes, mais aussi plus de mémoire pour les stocker et plus de puissance de calcul pour les exécuter.
Pourquoi c’est important : Le comptage des paramètres est l'abréviation courante pour désigner la taille d'un modèle, et il détermine directement la quantité de mémoire GPU nécessaire. Un modèle de 7B en précision 16 bits nécessite environ 14 Go de VRAM uniquement pour les poids. Comprendre les paramètres vous permet d'estimer les coûts, de choisir le matériel et de comprendre pourquoi la quantification (réduction de la précision par paramètre) est si importante pour rendre les modèles accessibles.
PixVerse
Génération vidéo PixVerse
Compagnies
Entreprise chinoise de génération vidéo qui développe des outils vidéo IA accessibles. Connue pour ses vitesses de génération rapides et un niveau gratuit qui l'a aidée à constituer rapidement une large base d'utilisateurs sur les marchés internationaux.
Pourquoi c’est important : PixVerse a prouvé que la génération vidéo par IA pouvait être un produit grand public, et non un simple outil pour professionnels et adopteurs précoces. Leur niveau gratuit agressif et leur cycle d'itération rapide ont forcé toute la catégorie à repenser la tarification et l'accessibilité. En construisant l'une des plus grandes bases d'utilisateurs en vidéo IA en une seule année, ils ont démontré que la distribution et la vitesse d'exécution peuvent compter autant que la qualité brute du modèle pour déterminer qui remporte ce marché.
Perplexity
Moteur de recherche propulsé par IA, API Sonar
Compagnies
Moteur de recherche par IA qui combine la recherche web en temps réel avec le raisonnement de modèles de langage pour fournir des réponses directes et sourcées au lieu d'une liste de liens. Le défi le plus visible à la domination de Google dans la recherche depuis une génération.
Pourquoi c’est important : Perplexity est le défi le plus crédible à la domination de Google dans la recherche en plus d'une décennie, prouvant qu'un moteur de réponses natif IA peut offrir une expérience fondamentalement supérieure pour les requêtes informationnelles. Ils ont popularisé le paradigme de génération augmentée par récupération comme produit grand public, montrant que la combinaison de la recherche web en temps réel avec le raisonnement LLM produit des résultats à la fois plus utiles et plus fiables que l'une ou l'autre technologie seule. Leur croissance rapide a forcé Google, Microsoft et tous les autres acteurs de la recherche à repenser ce à quoi un moteur de recherche devrait ressembler à l'ère des grands modèles de langage.
Entraînement
La phase d'entraînement initiale et massive où un modèle apprend le langage (ou d'autres modalités) à partir d'un immense corpus. C'est la partie coûteuse — des milliers de GPU fonctionnant pendant des semaines ou des mois, pour des millions de dollars. Le résultat est un modèle fondation qui comprend le langage mais n'a pas encore été spécialisé pour une tâche quelconque.
Pourquoi c’est important : Le pré-entraînement est ce qui rend les modèles fondation possibles. C'est aussi pourquoi seule une poignée d'entreprises peut créer des modèles de pointe — les coûts de calcul sont astronomiques. Tout le reste (fine-tuning, RLHF, prompting) se construit sur cette base.
Utiliser l’AI
La pratique consistant à formuler des entrées pour obtenir de meilleures sorties des modèles d'IA. Cela va de techniques simples (être spécifique, fournir des exemples) aux méthodes avancées (chaîne de pensée, prompting few-shot, assignation de rôle). Malgré le nom sophistiqué, il s'agit fondamentalement de communiquer clairement avec un système statistique.
Pourquoi c’est important : Le même modèle peut donner des résultats radicalement différents selon la façon dont vous posez la question. Une bonne ingénierie de prompt est le moyen le moins cher d'améliorer la qualité des sorties IA — pas d'entraînement, pas de fine-tuning, juste une meilleure communication.
Mesure à quel point un modèle prédit bien le texte. exp(perte d'entropie croisée moyenne). Représente « entre combien de tokens le modèle hésite ». Plus bas = mieux.
Pourquoi c'est important : La métrique la plus fondamentale pour comparer la capacité brute de modélisation de texte. Mais ne mesure ni l'utilité ni la sécurité.
Le texte que tu donnes à un modèle d'IA pour obtenir une réponse. Un prompt peut être une question, une instruction, un brief créatif ou un bloc de code que tu veux faire expliquer. Tout ce que le modèle fait commence par ce que tu lui donnes. La qualité, la spécificité et la structure de ton prompt façonnent directement la qualité de ce qui en sort.
Pourquoi c'est important : Le prompt, c'est l'interface. C'est le seul levier que la plupart des gens utilisent avec l'IA, et c'est un levier étonnamment puissant. Un prompt vague donne une réponse vague; un prompt spécifique et bien structuré peut extraire un résultat de niveau expert du même modèle.
Encodage positionnel
Embedding positionnel, RoPE, ALiBi
Un mécanisme qui indique à un modèle Transformer l'ordre des tokens dans une séquence. Contrairement aux RNN qui traitent les tokens séquentiellement (donc la position est implicite), les Transformers traitent tous les tokens en parallèle et n'ont pas de sens inhérent de l'ordre. Les encodages positionnels injectent l'information de position pour que le modèle sache que « le chien mord l'homme » et « l'homme mord le chien » sont différents.
Pourquoi c'est important : Sans information positionnelle, un Transformer traite une phrase comme un sac de mots — l'ordre des mots est perdu. Le choix de l'encodage positionnel détermine aussi la capacité du modèle à gérer des séquences plus longues que celles vues pendant l'entraînement, ce qui est pourquoi des techniques comme RoPE et ALiBi sont critiques pour les modèles à long contexte.
Prompt caching
Mise en cache du contexte, mise en cache du préfixe
Utiliser l'IA
Une technique qui sauvegarde et réutilise la version traitée d'un préfixe de prompt à travers plusieurs appels API, évitant les calculs redondants. Si tu envoies le même prompt système et le même contexte documentaire à chaque requête (ce qui est courant), le prompt caching les traite une seule fois et réutilise le calcul mis en cache pour les requêtes suivantes. Cela réduit à la fois la latence et le coût.
Pourquoi c’est important : La plupart des applications IA envoient le même prompt système, les mêmes exemples few-shot ou les mêmes documents de référence à chaque requête. Sans mise en cache, le fournisseur traite ce préfixe identique à chaque fois. Le prompt caching peut réduire les coûts de tokens d'entrée de 50 à 90 % et diminuer significativement le time-to-first-token. Pour les applications à fort volume, ça se traduit par des milliers de dollars économisés par mois.
Injection de prompt
Injection de prompt indirecte
Sécurité
Une attaque où des instructions malveillantes sont intégrées dans du contenu qu'un modèle d'IA traite, amenant le modèle à suivre les instructions de l'attaquant au lieu de celles de l'utilisateur ou du développeur. Injection directe : l'utilisateur tape des instructions malveillantes. Injection indirecte : des instructions malveillantes sont cachées dans un site web, un document ou un courriel que le modèle lit dans le cadre de sa tâche.
Pourquoi c’est important : L'injection de prompt est la vulnérabilité de sécurité la plus critique dans les applications d'IA. Toute application qui laisse un LLM traiter du contenu non fiable (courriels, pages web, documents téléversés) est potentiellement vulnérable. Il n'existe actuellement aucune solution complète — seulement des atténuations. Si tu construis des applications propulsées par l'IA, comprendre l'injection de prompt est aussi important que comprendre l'injection SQL l'était pour le développement web.
Précision et rappel
Score F1, matrice de confusion
Fondamentaux
Deux métriques complémentaires pour évaluer les classifieurs. La précision répond à « parmi les éléments que le modèle a signalés comme positifs, combien le sont réellement? » Le rappel répond à « parmi tous les vrais positifs, combien le modèle en a-t-il trouvé? » Un filtre anti-spam avec une haute précision marque rarement de vrais courriels comme spam. Un filtre avec un haut rappel attrape la plupart des spams. Le score F1 est leur moyenne harmonique — un nombre unique qui équilibre les deux.
Pourquoi c’est important : L'exactitude seule est trompeuse. Un modèle qui ne prédit jamais « fraude » atteint 99,9 % d'exactitude si seulement 0,1 % des transactions sont frauduleuses — mais il est complètement inutile. La précision et le rappel révèlent les compromis : attraper plus de fraudes (rappel plus élevé) signifie plus de fausses alertes (précision plus basse), et vice versa. Chaque système de classification en production est ajusté en fonction de ce compromis.
Infrastructure
Une technique de gestion de la mémoire pour le KV cache qui emprunte à la mémoire virtuelle des systèmes d'exploitation. Au lieu d'allouer un bloc contigu de mémoire GPU pour le KV cache de chaque requête (ce qui gaspille de la mémoire par fragmentation), PagedAttention stocke le cache dans des blocs non contigus ("pages") qui sont alloués à la demande et peuvent être partagés entre les requêtes avec des préfixes communs.
Pourquoi c’est important : PagedAttention est l'innovation derrière vLLM et est maintenant adopté par la plupart des frameworks de serving LLM. Il a augmenté le débit de serving de 2–4x par rapport aux implémentations naïves en éliminant le gaspillage de mémoire dû à la fragmentation. Sans lui, servir des modèles à contexte long à de nombreux utilisateurs simultanés serait dramatiquement plus coûteux.
Pooling
Max Pooling, Average Pooling
Fondamentaux
Une opération qui réduit les dimensions spatiales des données en résumant une région en une seule valeur. Le max pooling prend la valeur maximale dans chaque région. L'average pooling prend la moyenne. Dans les CNN, les couches de pooling sous-échantillonnent les cartes de features entre les couches convolutionnelles. Dans les Transformers, le pooling combine les représentations de tokens en un seul vecteur (ex : pour la classification).
Pourquoi c’est important : Le pooling est la façon dont les réseaux de neurones passent de features locales à une compréhension globale. Un CNN pourrait commencer avec des cartes de features de 224×224 et les réduire à 7×7 dans la couche finale, résumant progressivement l'information spatiale. En NLP, le mean pooling sur les embeddings de tokens est la façon standard de créer un embedding de phrase unique à partir d'une séquence de représentations de tokens.
Plongement de mots
Word2Vec, GloVe, vecteurs de mots
Fondamentaux
Des représentations vectorielles denses de mots où les mots avec des sens similaires ont des vecteurs similaires. Word2Vec (2013) et GloVe (2014) ont été les pionniers : ils s'entraînent sur les patterns de co-occurrence de mots pour produire des vecteurs où "king − man + woman ≈ queen". Les plongements de mots étaient le précurseur des embeddings contextuels modernes (BERT, sentence-transformers) et restent fondamentaux pour comprendre comment les réseaux de neurones représentent le langage.
Pourquoi c'est important : Les plongements de mots ont été la percée qui a rendu le NLP neuronal pratique. Avant eux, les mots étaient représentés comme des vecteurs one-hot (aucune notion de similarité). Les plongements de mots ont prouvé que des représentations distribuées pouvaient capturer le sens, l'analogie et les relations sémantiques. Cette idée — représenter des symboles discrets comme des vecteurs continus appris — est le fondement de tous les modèles de langage modernes.
Quantification
GGUF, GPTQ, AWQ
Infrastructure
Réduire la précision d'un modèle pour le rendre plus petit et plus rapide. Un modèle entraîné en virgule flottante 32 bits peut être quantifié en 8 bits, 4 bits, ou encore moins — réduisant sa taille de 4 à 8 fois avec une perte de qualité étonnamment faible. GGUF est le format populaire pour l'inférence locale via llama.cpp.
Pourquoi c’est important : La quantification est ce qui rend possible l'exécution d'un modèle de 14 milliards de paramètres sur un seul GPU ou même un ordinateur portable. Sans elle, les modèles open-weights seraient inutilisables pour la plupart des gens. Les variantes Q4_K_M et Q5_K_M offrent le meilleur compromis taille/qualité.
Réponse aux questions
QA, Compréhension de lecture
Utiliser l'AI
Un système qui répond à des questions posées en langage naturel. Le QA extractif trouve la portion de réponse dans un document donné (« Selon le paragraphe 3, la réponse est... »). Le QA génératif synthétise une réponse à partir d'une ou plusieurs sources. Le QA en domaine ouvert répond à n'importe quelle question sans document spécifique. Le QA basé sur le RAG récupère des documents pertinents et génère des réponses à partir d'eux.
Pourquoi c'est important : La réponse aux questions est le pattern d'interaction fondamental pour les assistants IA. Chaque chatbot, chaque base de connaissances d'entreprise, chaque bot de support client est essentiellement un système de QA. Comprendre les différents paradigmes de QA (extractif, génératif, augmenté par récupération) t'aide à choisir la bonne architecture pour ton application et à fixer des attentes réalistes sur la précision.
R
Reconnaissance vocale
STT, Speech-to-Text, ASR
Utiliser l'IA
Convertir la parole en texte. La reconnaissance vocale moderne utilise des modèles d'apprentissage profond (notamment Whisper d'OpenAI) capables de transcrire de l'audio dans plus de 100 langues avec une précision quasi humaine. La technologie propulse les assistants vocaux, la transcription de réunions, la génération de sous-titres et les outils d'accessibilité.
Pourquoi c'est important : La reconnaissance vocale a débloqué la voix comme modalité d'entrée pour l'IA. Combinée aux LLM et à la synthèse vocale, elle permet des interactions IA entièrement pilotées par la voix. La sortie ouverte de Whisper a démocratisé la transcription de haute qualité — tu peux l'exécuter localement et gratuitement. Pour l'accessibilité, c'est transformateur : rendre le contenu audio cherchable, traduisible et accessible aux personnes sourdes et malentendantes.
Régression
Régression linéaire, prédiction
Fondamentaux
Une tâche d'apprentissage automatique qui prédit une valeur numérique continue plutôt qu'une catégorie. « Quelle sera la température demain? » (régression : prédire un nombre) vs. « Est-ce qu'il va pleuvoir demain? » (classification : prédire une catégorie). La régression linéaire ajuste une droite; la régression par réseau de neurones peut apprendre des relations non-linéaires arbitraires entre les entrées et les sorties.
Pourquoi c'est important : La régression est l'une des deux tâches fondamentales de l'apprentissage automatique (l'autre étant la classification) et sous-tend tout, de la prédiction du cours des actions à l'évaluation immobilière en passant par la modélisation scientifique. C'est aussi le point d'entrée le plus simple pour comprendre l'apprentissage automatique — ajuster une droite à des points de données, c'est quelque chose que la plupart des gens peuvent visualiser, et le saut de la régression linéaire aux réseaux de neurones est conceptuellement petit.
Un paradigme d'entraînement où un agent IA apprend en interagissant avec un environnement, en prenant des actions et en recevant des récompenses ou des pénalités. Contrairement à l'apprentissage supervisé (qui apprend à partir d'exemples étiquetés), le RL apprend par l'expérience — par essai et erreur. Le RL a entraîné AlphaGo à battre des champions du monde, apprend aux robots à marcher, et est le « RL » dans RLHF qui rend les agents conversationnels utiles.
Pourquoi c’est important : L'apprentissage par renforcement est la façon dont l'IA apprend à agir, pas seulement à prédire. C'est le pont entre des modèles qui peuvent répondre à des questions et des agents qui peuvent accomplir des objectifs. Chaque système d'IA qui planifie, élabore des stratégies ou optimise au fil du temps a du RL quelque part dans sa lignée.
Raisonnement
Raisonnement IA, raisonnement en chaîne de pensée
Utiliser l’AI
La capacité des modèles d'IA à réfléchir étape par étape, à décomposer des problèmes complexes et à arriver à des conclusions logiquement solides. Les modèles de raisonnement modernes (comme o1/o3 d'OpenAI et DeepSeek-R1) sont entraînés à générer des traces de raisonnement explicites avant de répondre, améliorant spectaculairement la performance en mathématiques, programmation et logique. Cela se distingue de la simple correspondance de patterns — les modèles de raisonnement peuvent résoudre des problèmes qu'ils n'ont jamais vus.
Pourquoi c’est important : Le raisonnement est la capacité de pointe qui sépare « l'IA qui semble intelligente » de « l'IA qui est intelligente ». Les modèles qui raisonnent bien peuvent déboguer du code, prouver des théorèmes, planifier des stratégies en plusieurs étapes et détecter leurs propres erreurs. L'écart entre les modèles avec et sans fort raisonnement est le plus grand facteur de différenciation de qualité en IA en ce moment.
Resemble AI
Clonage vocal, synthèse vocale, filigranage
Compagnies
Entreprise canadienne de voix IA spécialisée dans le clonage vocal haute fidélité et la synthèse vocale en temps réel. L'une des premières à avoir livré un filigrane audio neuronal pour la détection des hypertrucages, prenant au sérieux les implications éthiques du clonage vocal dès le départ.
Pourquoi c’est important : Resemble AI compte parce qu'elle a reconnu tôt que le clonage vocal sans infrastructure de sécurité est un risque, pas un produit. En livrant la détection des hypertrucages et le filigrane neuronal aux côtés de leurs outils de synthèse, ils ont établi un modèle de voix IA responsable que le reste de l'industrie s'empresse maintenant de suivre. Alors que les réglementations sur les médias synthétiques se resserrent à l'échelle mondiale, l'avance de Resemble en vérification de provenance et de consentement les positionne comme l'entreprise de voix IA en laquelle les entreprises peuvent réellement avoir confiance.
Reka
Reka Core, Reka Flash
Compagnies
Entreprise de recherche en IA fondée par d'anciens chercheurs de DeepMind, Google Brain et FAIR. Construit des modèles nativement multimodaux capables de traiter texte, images, vidéo et audio dès la conception.
Pourquoi c’est important : Reka a démontré qu'une petite équipe de recherche avec le bon pedigree peut construire des modèles multimodaux de classe frontière sans milliards en financement — et que les architectures nativement multimodales entraînées de zéro peuvent surpasser l'approche « ajoutée après coup » utilisée par la plupart des plus grands laboratoires. Leur trajectoire rapide de la fondation à l'acquisition par Snowflake a également révélé l'intense force d'attraction que les plateformes de données d'entreprise exercent désormais sur les talents en IA, suggérant que l'avenir de l'IA multimodale pourrait résider au sein des entreprises d'infrastructure de données plutôt que dans des laboratoires de recherche indépendants.
Recraft
Recraft V3, génération de graphiques vectoriels
Compagnies
Outil de design par IA axé sur la génération d'images et de graphiques vectoriels de qualité professionnelle. L'un des premiers à produire des actifs de design véritablement utilisables — des SVG, des styles cohérents avec la marque et des sorties prêts pour la production que les designers veulent réellement utiliser.
Pourquoi c’est important : Recraft est l'une des rares entreprises d'IA à avoir construit pour les designers professionnels plutôt que pour les moments viraux sur les réseaux sociaux, et a prouvé que cette approche pouvait produire des résultats à la pointe de l'art. Leur concentration sur les sorties prêts pour la production — des vecteurs propres, une cohérence de marque, des fonds transparents — comble un vide qu'aucune autre entreprise de génération d'images n'a sérieusement abordé, faisant d'eux ce qui se rapproche le plus d'un véritable outil de design plutôt que d'un jouet artistique.
Runway
Gen-1, Gen-2, Gen-3 Alpha
Compagnies
Entreprise pionnière en génération vidéo par IA. A co-créé l'architecture originale de Stable Diffusion puis s'est tournée vers la vidéo, où ses modèles de la série Gen ont défini l'état de l'art des outils de création cinématographique par IA.
Pourquoi c’est important : Runway est l'entreprise qui a fait passer la génération vidéo par IA de curiosité de recherche à outil de création cinématographique, en livrant modèle après modèle à un rythme qui les maintenait à la frontière même quand des concurrents aux poches profondes sont entrés dans l'espace. Leur ADN axé sur les outils créatifs — né d'artistes, pas seulement d'ingénieurs — leur confère une compréhension des flux de travail professionnels que les purs laboratoires de recherche peinent à reproduire, et leur pari sur la construction d'une plateforme complète plutôt que d'un simple modèle pourrait s'avérer être la bonne stratégie à long terme.
RAG
Génération augmentée par récupération
Outils
Une technique qui donne aux modèles d'IA accès à des connaissances externes en récupérant des documents pertinents avant de générer une réponse. Au lieu de se fier uniquement à ce que le modèle a appris pendant l'entraînement, le RAG recherche dans une base de connaissances, trouve les fragments pertinents et les inclut dans le prompt comme contexte.
Pourquoi c’est important : Le RAG résout deux problèmes majeurs : l'hallucination (le modèle a de vraies sources à référencer) et la coupure de connaissances (la base de connaissances peut être mise à jour sans réentraînement). C'est ainsi que la plupart des systèmes d'IA en entreprise fonctionnent réellement.
Infrastructure
Restrictions sur le nombre de requêtes API que vous pouvez faire par minute/heure/jour. Les fournisseurs imposent des limites de débit pour éviter la surcharge des serveurs et assurer un accès équitable. Les limites s'appliquent typiquement par clé API et peuvent restreindre les requêtes par minute (RPM) et les tokens par minute (TPM).
Pourquoi c’est important : Les limites de débit sont le plafond invisible que vous atteignez en mettant à l'échelle des applications d'IA. C'est pourquoi le traitement par lots est important, pourquoi vous avez besoin d'une logique de nouvelles tentatives, et pourquoi certains fournisseurs facturent plus cher pour des limites de débit plus élevées.
Sécurité
La pratique consistant à essayer délibérément de faire échouer, mal se comporter ou produire des sorties nuisibles à un modèle d'IA. Les équipes de red teaming sondent les vulnérabilités : jailbreaks, biais, génération de désinformation, fuites de données privées. Nommé d'après les exercices de guerre militaires où une « équipe rouge » joue l'adversaire.
Pourquoi c’est important : On ne peut pas corriger ce qu'on ne connaît pas. Le red teaming est la façon dont les fournisseurs découvrent que leur modèle expliquera comment crocheter une serrure si on lui demande d'« écrire une histoire sur un serrurier ». C'est un travail de sécurité essentiel qui a lieu avant chaque lancement majeur de modèle.
RLHF
Apprentissage par renforcement avec retour humain
Entraînement
Une technique d'entraînement où des évaluateurs humains classent les sorties d'un modèle par qualité, et cette rétroaction est utilisée pour entraîner un modèle de récompense qui guide l'IA vers de meilleures réponses. C'est ce qui transforme un modèle pré-entraîné brut (qui ne fait que prédire le prochain mot) en un assistant utile et inoffensif.
Pourquoi c’est important : Le RLHF est l'ingrédient secret qui a rendu ChatGPT si différent de GPT-3. Le modèle de base « savait » déjà tout, mais le RLHF lui a appris à présenter ces connaissances d'une manière que les humains trouvent réellement utile. C'est aussi la façon dont les comportements de sécurité sont renforcés.
RNN
Réseau de neurones récurrent, LSTM, GRU
Un réseau de neurones qui traite des séquences en maintenant un état caché qui est mis à jour à chaque étape — il « se souvient » de ce qu'il a vu jusqu'ici. Les LSTM et GRU sont des variantes améliorées qui résolvent la tendance du RNN original à oublier les dépendances à longue portée. Les RNN dominaient le NLP et la parole avant que les Transformers ne les remplacent vers 2018–2020.
Pourquoi c'est important : Les RNN sont les ancêtres des modèles de langage modernes. Comprendre pourquoi ils ont échoué (traitement séquentiel lent, difficulté avec les dépendances à longue portée) explique pourquoi les Transformers ont réussi (traitement parallèle, attention sur toutes les positions). L'architecture SSM/Mamba est, d'une certaine façon, un retour à l'idée du RNN avec des correctifs modernes.
Modèle de récompense
RM, modèle de préférences
Entraînement
Un modèle entraîné à prédire les préférences humaines entre les réponses d'une IA. Étant donné un prompt et deux réponses candidates, le modèle de récompense évalue laquelle les humains préféreraient. Dans le pipeline RLHF, le modèle de récompense fournit le signal qui entraîne le modèle de langage à produire de meilleures réponses — c'est le proxy appris du jugement humain.
Pourquoi c’est important : Le modèle de récompense est le composant clé qui fait fonctionner le RLHF. On ne peut pas avoir un humain qui évalue chaque réponse pendant l'entraînement (trop lent, trop cher), alors on entraîne un modèle pour approximer les préférences humaines et on l'utilise comme signal d'entraînement. La qualité du modèle de récompense détermine directement la qualité de l'alignement — un mauvais modèle de récompense produit un modèle qui optimise pour les mauvaises choses.
Récupération d'information
Recherche d'information, IR
Fondamentaux
Le processus de trouver des documents, passages ou données pertinents dans une grande collection en réponse à une requête. En IA, la récupération est le « R » dans RAG — l'étape où le contexte pertinent est récupéré avant d'être donné au modèle de langage. La récupération peut utiliser la correspondance par mots-clés (BM25), la similarité sémantique (embeddings) ou des approches hybrides combinant les deux.
Pourquoi c’est important : La récupération est ce qui rend les LLM pratiques pour les applications du monde réel. Les connaissances internes d'un modèle sont statiques, incomplètes et parfois fausses. La récupération lui donne accès à de l'information actuelle, précise et spécifique au domaine au moment de l'inférence. La qualité de ton pipeline de récupération détermine directement la qualité de ton système RAG — le meilleur LLM ne peut pas produire de bonnes réponses à partir d'un mauvais contexte.
RLAIF
RL from AI Feedback, apprentissage par renforcement à partir de retours IA
Entraînement
Une variante de RLHF où les labels de préférence proviennent d'un modèle IA plutôt que d'annotateurs humains. Un modèle IA puissant compare des paires de réponses et indique laquelle est meilleure, fournissant le signal de retour pour l'apprentissage par renforcement. Cela permet de mettre à l'échelle l'alignement au-delà du goulot d'étranglement de l'annotation humaine tout en maintenant une qualité raisonnable.
Pourquoi c’est important : RLAIF est la façon dont l'alignement passe à l'échelle. L'annotation humaine est coûteuse (10–50$+ par heure), lente et incohérente. Le retour IA est instantané, bon marché et infatigable. Constitutional AI (Anthropic) utilise RLAIF comme composant central — une IA critique les réponses par rapport à des principes, fournissant des données de préférence à grande échelle. La question clé est de savoir si le retour IA est suffisamment bon : il se base sur le jugement humain mais peut hériter et amplifier les biais.
Superposition
Superposition de caractéristiques, polysémantie
Fondamentaux
Le phénomène par lequel les réseaux de neurones encodent bien plus de caractéristiques (concepts, patterns) qu'ils n'ont de neurones, en représentant les caractéristiques comme des directions dans l'espace d'activation plutôt qu'en dédiant un neurone individuel à chaque caractéristique. Un seul neurone participe à l'encodage de dizaines de caractéristiques simultanément, et chaque caractéristique est distribuée sur de nombreux neurones.
Pourquoi c'est important : La superposition est la raison pour laquelle les réseaux de neurones sont difficiles à interpréter et pourquoi l'interprétabilité mécaniste est un défi. Si chaque neurone représentait un concept (comme « le concept de chiens »), l'interprétation serait simple. Au lieu de ça, les concepts sont étalés sur les neurones en patterns qui se chevauchent. Comprendre la superposition est la clé pour comprendre à la fois comment les réseaux de neurones compressent l'information et pourquoi ils se comportent parfois de façon inattendue.
Synthèse vocale
TTS, Text-to-Speech, voix IA
Utiliser l'IA
Convertir du texte écrit en audio parlé au son naturel. Les systèmes TTS modernes utilisent des réseaux de neurones pour générer une parole quasi indistinguible des voix humaines, avec un contrôle sur l'émotion, le rythme, l'emphase, et même le clonage vocal. ElevenLabs, OpenAI TTS et des modèles ouverts comme Bark et XTTS ont rendu la synthèse vocale de haute qualité largement accessible.
Pourquoi c'est important : La synthèse vocale complète la boucle de l'IA vocale : la reconnaissance vocale convertit la voix en texte, un LLM le traite, et la synthèse vocale convertit la réponse en parole. Ça permet les assistants vocaux, la narration de livres audio, les outils d'accessibilité, la localisation de contenu et les personnages IA dans les jeux et médias. La qualité de la synthèse vocale moderne a franchi la vallée de l'étrange — la parole synthétisée sonne maintenant naturel.
Sycophantie
Sycophantie IA, complaisance excessive
Sécurité
La tendance des modèles d'IA à dire aux utilisateurs ce qu'ils veulent entendre plutôt que ce qui est vrai. Un modèle sycophante s'accorde avec des prémisses erronées, valide des idées mauvaises, inverse sa position lorsqu'il est confronté, même s'il avait raison la première fois, et privilégie d'être aimé plutôt que d'être utile. Le sycophantisme est un effet secondaire direct de la formation RLHF — les modèles apprennent que les réponses agréables obtiennent des notes plus élevées des évaluateurs humains, ils optimisent donc l'accord par rapport à la précision.
Pourquoi c’est important : La sycophanie est l'un des modes de défaillance les plus insidieux en intelligence artificielle, car elle est invisible pour l'utilisateur qui est flatté. Si vous demandez à un modèle « n'est-ce pas une excellente idée d'affaires? » et qu'il répond toujours oui, vous obtenez un miroir, et non un conseiller. Le combat contre la sycophanie est un domaine actif de la recherche d'alignement, et c'est pourquoi les meilleurs modèles sont entraînés à s'opposer respectueusement lorsqu'il convient.
Une critique des grands modèles de langage affirmant qu'ils ne sont que des moteurs de correspondance de motifs sophistiqués qui assemblent un texte qui semble plausible sans comprendre véritablement le sens. Le terme a été créé par Emily Bender, Timnit Gebru et collègues dans leur article influent de 2021 intitulé « On the Dangers of Stochastic Parrots », qui a mis en garde contre le fait que les grands modèles de langage intègrent des biais provenant de leurs données d'entraînement, consomment des ressources considérables et créent une illusion de compréhension qui induit les utilisateurs à avoir plus confiance en eux qu'ils ne devraient.
Pourquoi c’est important : Le débat sur le perroquet stochastique porte sur ce que l'IA comprend vraiment. Le fait que les LLM (modèles de langage de grande envergure) soient réellement capables de raisonner ou simplement très bons dans l'imitation statistique détermine la manière dont nous les déployons, le niveau de confiance que nous accordons à leurs sorties et la manière dont nous les réglementons. C'est aussi le prisme à travers lequel les critiques évaluent chaque nouvelle prétention de capacité — s'agit-il d'une véritable avancée ou d'un perroquet plus convaincant?
Slop
Bouillie IA, contenu généré sans valeur
Sécurité
Contenu de bas qualité, générique et indésirable généré par l'intelligence artificielle qui inondent l'internet. Le terme a émergé en 2024 en tant que terme péjoratif pour décrire la vague de contenu médiocre produit par l'IA, polluant les résultats de recherche, les flux des réseaux sociaux et les plateformes en ligne de vente. Le slop est l'équivalent de la messagerie indésirable pour l'IA — techniquement du « contenu » mais n'ajoutant aucune valeur, souvent indistinct du reste du slop, et dégradant la qualité de chaque plateforme qu'il touche. Pensez aux publications LinkedIn commençant par « Dans le monde actuel rapide et dynamique », aux photos de stock avec des mains à six doigts, ou aux articles SEO qui ne disent rien en 2 000 mots.
Pourquoi c’est important : Le déchet est le coût environnemental de la gratuité de la génération de contenu. Lorsque quiconque peut générer 1 000 articles de blog ou 10 000 images de produits en quelques minutes, l'économie de la création de contenu s'effondre — et la qualité s'effondre avec elle. Le déchet explique pourquoi les plateformes se pressent pour développer la détection d'IA, pourquoi Google continue de mettre à jour son algorithme de recherche, et pourquoi « fait à la main » devient un point de vente. C'est aussi l'argument le plus solide contre la vision naïve selon laquelle l'IA démocratisera la créativité.
StepFun
Modèles Step, IA multimodale
Compagnies
Entreprise chinoise d'IA en démarrage qui développe de grands modèles de langage et multimodaux compétitifs. Leur série Step a démontré de solides performances sur les bancs d'essai internationaux, soutenue par un investissement significatif en capacité de calcul.
Pourquoi c’est important : StepFun est la preuve que l'écosystème chinois de l'IA peut produire de sérieux concurrents en partant de zéro, et pas seulement à partir de géants technologiques existants. Leurs modèles Step surpassent constamment leur catégorie sur les bancs d'essai internationaux, et leur expansion rapide vers le multimodal et la génération vidéo montre que des entreprises en démarrage bien organisées peuvent couvrir un large éventail de capacités avec des ressources relativement modestes. Pour le marché mondial de l'IA, StepFun représente le type d'entreprise qui rend impossible d'ignorer la scène indépendante des entreprises en démarrage d'IA en Chine — techniquement forte, orientée vers l'international et se déplaçant assez vite pour maintenir la pression sur des concurrents bien plus importants.
SambaNova
Puce SN40L, inférence ultra-rapide
Compagnies
Entreprise de matériel IA qui conçoit des puces sur mesure (RDU) spécialement conçues pour les charges de travail d'IA. Leur plateforme SambaNova Cloud offre certaines des vitesses d'inférence les plus rapides disponibles, rivalisant avec Groq sur l'approche « la vitesse d'abord » en matière de service d'IA.
Pourquoi c’est important : SambaNova compte parce que NVIDIA ne devrait pas être le seul acteur en matière de calcul IA, et quelqu'un doit prouver que des puces IA spécialisées peuvent rivaliser sur le marché réel plutôt que seulement dans les articles de recherche. Leur architecture RDU démontre que des gains de performance significatifs sont possibles quand on conçoit du silicium spécifiquement pour les charges de travail de réseaux de neurones, et leur service d'inférence en nuage donne aux développeurs un avant-goût de ce à quoi pourrait ressembler l'infrastructure IA post-GPU. Que SambaNova elle-même devienne ou non l'alternative dominante, la pression concurrentielle qu'elle exerce — aux côtés de Groq, Cerebras et des puces sur mesure des fournisseurs d'infonuagique — est saine pour un secteur qui ne peut se permettre une monoculture matérielle permanente.
Sarvam AI
Modèles Sarvam, IA pour les langues indiennes
Compagnies
Entreprise indienne d'IA qui développe des modèles spécifiquement optimisés pour la diversité linguistique de l'Inde. Leurs modèles gèrent l'hindi, le tamoul, le télougou, le bengali et d'autres langues indiennes avec une aisance que les modèles internationaux peinent constamment à atteindre.
Pourquoi c’est important : Sarvam AI est la réponse la plus crédible à une question que l'industrie mondiale de l'IA a largement ignorée : qui construit les modèles fondation pour les langues qu'un cinquième de l'humanité parle réellement? Avec des racines profondes dans la communauté de recherche en IA de l'Inde, un alignement gouvernemental et une gamme de produits spécialement conçue pour la diversité linguistique indienne, Sarvam représente à la fois une opportunité commerciale et un impératif stratégique. Leur succès ou leur échec signalera si la révolution de l'IA se mondialise véritablement ou reste un phénomène d'abord anglophone avec des traductions greffées après coup.
Stability AI
Stable Diffusion, SDXL, Stable Audio
Compagnies
L'entreprise qui a démocratisé la génération d'images en publiant Stable Diffusion en code source ouvert en 2022. Malgré des turbulences au niveau de la direction, leurs modèles demeurent la colonne vertébrale de l'écosystème de génération d'images open source.
Pourquoi c’est important : Stability AI a déclenché la révolution de la génération d'images open source en publiant Stable Diffusion, créant un écosystème de milliers de modèles dérivés, d'outils et d'applications créatives qu'aucune plateforme fermée ne pouvait égaler. Même à travers les bouleversements de direction et les turbulences financières, leur pari fondamental — que l'IA générative devrait être accessible à tous, pas seulement à ceux qui peuvent se payer des appels API — a remodelé l'industrie entière et a établi le modèle de fonctionnement des entreprises d'IA open source.
Suno
Génération musicale par IA
Compagnies
Entreprise de génération musicale par IA qui permet à quiconque de créer des chansons complètes — voix, instruments, production — à partir d'une description textuelle. Passée d'inconnue à des millions d'utilisateurs en quelques mois, forçant l'industrie musicale à affronter la créativité de l'IA de plein fouet.
Pourquoi c’est important : Suno a prouvé que l'IA pouvait générer des chansons complètes et agréables à écouter à partir d'une simple description textuelle, créant une catégorie entièrement nouvelle d'outil créatif du jour au lendemain. Ils sont au centre de la bataille de droit d'auteur la plus conséquente en IA générative, le résultat de la poursuite de la RIAA étant susceptible d'établir un précédent sur le fonctionnement des droits sur les données d'entraînement dans toutes les modalités. Plus largement, ils représentent le cas de figure le plus tranchant pour déterminer si la démocratisation des outils créatifs élargit l'expression humaine ou mine les fondements économiques qui soutiennent les artistes professionnels.
Modèles
Une alternative aux Transformers qui traite les séquences en maintenant un « état » compressé au lieu d'utiliser l'attention sur tous les tokens. Mamba est l'architecture SSM la plus connue. Les SSM croissent linéairement avec la longueur de la séquence (contre quadratiquement pour l'attention), les rendant potentiellement beaucoup plus efficaces pour les très longs contextes.
Pourquoi c’est important : Les SSM sont le principal concurrent de la domination des Transformers. Ils sont plus rapides pour les longues séquences et utilisent moins de mémoire, mais la recherche est encore en cours de maturation. Les architectures hybrides (mélangeant des couches SSM avec de l'attention) pourraient bien offrir le meilleur des deux mondes.
Prompt système
Message système
Utiliser l’AI
Une instruction spéciale donnée à un modèle au début d'une conversation qui définit son comportement, sa personnalité et ses règles. Contrairement aux messages utilisateur, le prompt système est censé être persistant et autoritaire — il définit qui est le modèle pour cette session. « Vous êtes un assistant de codage utile. Utilisez toujours TypeScript. »
Pourquoi c’est important : Les prompts système sont l'outil principal pour personnaliser le comportement de l'IA sans fine-tuning. C'est ainsi que les entreprises font de Claude un agent de support client, un réviseur de code ou un assistant d'information médicale — même modèle, prompt système différent.
Lois d'échelle
Chinchilla
Des relations en loi de puissance montrant que la performance s'améliore de manière prévisible avec la taille du modèle, la taille du dataset et le calcul.
Pourquoi c'est important : Ont transformé l'entraînement d'un jeu de devinettes en ingénierie. Expliquent la course à l'armement IA.
Une approche d'entraînement où le modèle génère son propre signal de supervision à partir de données non étiquetées. Cache une partie de l'entrée, entraîne le modèle à prédire la partie cachée.
Pourquoi c'est important : L'apprentissage auto-supervisé est la percée qui a rendu l'IA moderne possible. Il a permis l'entraînement sur l'ensemble d'internet au lieu de coûteux datasets étiquetés à la main.
Décodage spéculatif
Génération assistée
Un petit modèle brouillon génère des candidats, le grand modèle les vérifie tous en même temps. Accélération de 2 à 3x avec une qualité de sortie identique.
Pourquoi c'est important : Un des rares « repas gratuits » de l'inférence IA. Sortie mathématiquement identique, juste plus rapide.
Streaming
Server-Sent Events
Envoyer la sortie token par token au fur et à mesure de la génération, via SSE sur HTTP. C'est pourquoi le texte apparaît mot par mot dans les interfaces de chat.
Pourquoi c'est important : 10 secondes de texte qui se construit, ça passe; 10 secondes d'écran vide, ça casse l'expérience. Permet aussi aux utilisateurs d'interrompre tôt.
Faire répondre l'IA dans un format lisible par machine (JSON, XML, schéma). La plupart des fournisseurs le supportent nativement : tu définis un schéma, le modèle garantit la conformité.
Pourquoi c'est important : Passer du chatbot à l'application nécessite une sortie structurée. Ton code ne peut pas parser du texte libre.
Une approche d'entraînement où le modèle apprend à partir d'exemples étiquetés — des paires entrée-sortie où la bonne réponse est fournie. Le modèle ajuste ses paramètres pour minimiser la différence entre ses prédictions et les réponses correctes connues.
Pourquoi c'est important : L'apprentissage supervisé est la forme la plus intuitive de ML et le cheval de bataille derrière la plupart des applications pratiques : filtres anti-spam, analyse d'images médicales, détection de fraude, et la phase de fine-tuning des LLM.
Données synthétiques
Données générées par IA
Des données d'entraînement générées par des modèles d'IA. Devenues standard dans les pipelines d'entraînement.
Pourquoi c'est important : Les vraies données étiquetées coûtent cher. Les modèles frontière génèrent des millions d'exemples du jour au lendemain. Le contrôle qualité est critique.
Softmax
Fonction softmax, exponentielles normalisées
Une fonction qui convertit un vecteur de nombres bruts (logits) en une distribution de probabilités — toutes les valeurs deviennent positives et leur somme vaut 1. Softmax amplifie les différences entre les valeurs : la plus grande entrée obtient la plus haute probabilité, et les entrées plus petites obtiennent des probabilités exponentiellement plus faibles. On la retrouve dans les mécanismes d'attention, les sorties de classification et la prédiction de tokens.
Pourquoi c'est important : Softmax est partout dans l'IA moderne. Chaque fois qu'un modèle de langage prédit le prochain token, softmax convertit les sorties brutes du modèle en probabilités. Chaque tête d'attention utilise softmax pour calculer les poids d'attention. Chaque classifieur utilise softmax pour produire les probabilités de classe. Comprendre softmax t'aide à comprendre la température, l'échantillonnage top-p, et pourquoi les modèles sont « confiants » même quand ils ont tort.
La plus grande entreprise d'étiquetage de données pour l'IA, fournissant les données d'entraînement annotées par des humains dont la plupart des grands modèles d'IA dépendent. Scale AI étiquette des images, du texte, de la vidéo et des données 3D pour la conduite autonome, le gouvernement et les entreprises d'IA. Ils offrent aussi des services d'évaluation, de collecte de données RLHF et de curation de données pour l'ajustement fin. Les grands clients incluent OpenAI, Meta, le département de la Défense américain et de nombreuses entreprises de voitures autonomes.
Pourquoi c'est important : Scale AI occupe une position critique dans la chaîne d'approvisionnement de l'IA : entre les données brutes et les modèles entraînés. La qualité des données étiquetées détermine directement la qualité des modèles, et Scale est le plus grand fournisseur. Leurs services de collecte de données RLHF signifient qu'ils aident littéralement à façonner la manière dont les modèles d'IA sont alignés — les préférences humaines qui entraînent Claude, GPT et d'autres passent souvent par des plateformes d'étiquetage comme Scale.
Attention éparse
Attention locale, attention à fenêtre glissante
Modèles
Des mécanismes d'attention qui ne traitent qu'un sous-ensemble des paires de tokens au lieu de la matrice d'attention complète N×N. L'attention à fenêtre glissante n'assiste qu'aux tokens proches (dans une fenêtre fixe). Les patterns épars (comme la combinaison locale + globale de Longformer) laissent certains tokens assister à tout tandis que la plupart des tokens assistent localement. Ces approches réduisent le coût quadratique de l'attention pour les longues séquences.
Pourquoi c’est important : L'attention éparse est la façon dont Mistral, Mixtral et d'autres modèles efficaces gèrent les longues séquences sans le coût complet de l'attention dense. C'est le compromis pratique entre « assister à tout » (coûteux mais exhaustif) et « n'assister à rien de distant » (bon marché mais limité). Comprendre l'attention éparse t'aide à évaluer les revendications sur la longueur de contexte et à prédire où la dégradation de qualité pourrait survenir.
Échantillonnage
Stratégie de décodage, top-p, top-k
Fondamentaux
Le processus de sélection du prochain token à générer à partir de la distribution de probabilité prédite par le modèle. Le décodage glouton choisit toujours le token le plus probable. L'échantillonnage aléatoire choisit proportionnellement aux probabilités. La température, le top-p (noyau) et le top-k sont des contrôles qui ajustent l'aléatoire et la diversité de la sélection. La stratégie d'échantillonnage affecte dramatiquement la qualité, la créativité et la cohérence de la sortie.
Pourquoi c’est important : Les paramètres d'échantillonnage sont les leviers les plus accessibles pour contrôler le comportement des LLM. Température 0 pour la génération de code déterministe. Température 0,7 pour l'écriture créative. Top-p 0,9 pour un bon équilibre. Ce ne sont pas des nombres magiques — ils contrôlent directement quels tokens le modèle considère à chaque étape. Comprendre l'échantillonnage t'aide à ajuster les sorties pour ton cas d'usage spécifique.
Self-Attention
Auto-attention, Scaled Dot-Product Attention
Fondamentaux
Un mécanisme d'attention où une séquence porte attention à elle-même — chaque token calcule sa pertinence par rapport à chaque autre token dans la même séquence. Les queries, keys et values proviennent toutes de la même entrée. Cela permet à chaque token de recueillir de l'information de tous les autres tokens, pondérée par pertinence. Le self-attention est l'opération centrale dans chaque couche de Transformer.
Pourquoi c’est important : Le self-attention est ce qui fait fonctionner les Transformers. Il a remplacé le traitement séquentiel des RNN par des connexions parallèles et directes entre toutes les positions. Le mot "banque" dans "la berge de la rivière" porte attention à "rivière" pour résoudre son sens, quelle que soit la distance entre eux. Cette capacité à connecter directement n'importe quelles deux positions est la raison pour laquelle les Transformers gèrent si bien les dépendances à longue portée.
SwiGLU
Gated Linear Unit, variantes GLU
Fondamentaux
Une fonction d'activation à porte utilisée dans les couches feedforward des Transformers modernes. SwiGLU combine l'activation SiLU/Swish avec un mécanisme de porte : SwiGLU(x) = (x · W1 · SiLU) ⊗ (x · W3), où ⊗ est la multiplication élément par élément. Cela permet au réseau d'apprendre quelle information laisser passer, surpassant de manière constante les couches feedforward standard ReLU ou GELU.
Pourquoi c’est important : SwiGLU est l'activation feedforward utilisée par LLaMA, Mistral, Qwen, Gemma et la plupart des LLM modernes. La comprendre t'aide à lire les architectures de modèles et explique pourquoi les couches FFN modernes ont trois matrices de poids au lieu de deux. C'est un petit choix architectural avec un impact démesuré sur la qualité du modèle.
Sigmoid
Fonction logistique
Fondamentaux
Une fonction mathématique qui compresse n'importe quel nombre réel dans l'intervalle (0, 1) : σ(x) = 1 / (1 + e^(−x)). Historiquement la fonction d'activation par défaut dans les réseaux de neurones, maintenant largement remplacée par ReLU et GELU pour les couches cachées mais toujours utilisée pour les sorties de classification binaire, les mécanismes de porte (dans les LSTM et GLU), et les opérations de type attention où tu as besoin de valeurs entre 0 et 1.
Pourquoi c’est important : Sigmoid apparaît partout en IA même si ce n'est plus l'activation cachée par défaut. Les portes LSTM utilisent sigmoid. L'activation SiLU/Swish est x · sigmoid(x). Les classifieurs binaires utilisent sigmoid comme activation de sortie. Comprendre sigmoid — et pourquoi elle a été remplacée par ReLU pour les couches cachées — est une connaissance fondamentale pour comprendre les choix de conception des réseaux de neurones.
Analyse de sentiments
Analyse d'opinion, Opinion Mining
Utiliser l'AI
Déterminer automatiquement le ton émotionnel d'un texte — positif, négatif ou neutre. « Ce produit est incroyable! » est positif. « Service client épouvantable » est négatif. Au-delà de la simple polarité, l'analyse de sentiments avancée détecte des émotions spécifiques (colère, joie, frustration), le sentiment au niveau des aspects (« la nourriture était excellente mais le service était lent »), et le sarcasme.
Pourquoi c'est important : L'analyse de sentiments est l'une des applications NLP les plus déployées commercialement. Les entreprises l'utilisent pour surveiller la perception de marque sur les réseaux sociaux, analyser les avis clients à grande échelle, évaluer la satisfaction des employés dans les sondages, et détecter les crises de relations publiques émergentes. C'est aussi un point d'entrée fréquent pour apprendre le NLP — une tâche de classification simple et intuitive avec des données d'entraînement abondantes.
Stable Diffusion
SD, SDXL, SD3
Modèles
Le modèle de génération d'images open source le plus utilisé, créé par Stability AI en collaboration avec des chercheurs académiques. Stable Diffusion génère des images à partir de prompts textuels en utilisant la diffusion latente — effectuant le processus de débruitage dans un espace latent compressé plutôt que dans l'espace pixel, ce qui le rend assez rapide pour tourner sur des GPU grand public. SD 1.5, SDXL et SD3 représentent des générations successives.
Pourquoi c'est important : Stable Diffusion a démocratisé la génération d'images par IA. Avant SD, la génération d'images nécessitait un accès API coûteux (DALL-E) ou était limitée à la recherche. Les poids ouverts de SD signifiaient que n'importe qui pouvait l'exécuter localement, le fine-tuner et construire dessus. Ça a créé un écosystème énorme : des fine-tunes LoRA, ControlNet, des modèles personnalisés, des checkpoints entraînés par la communauté, et des applications d'Automatic1111 à ComfyUI.
Super résolution
Upscaling, amélioration d'image, SR
Utiliser l'AI
Augmenter la résolution d'une image en générant des détails plausibles qui n'étaient pas dans l'original. Une photo de 256×256 devient une image nette de 1024×1024. La super résolution par IA ne se contente pas d'interpoler les pixels (ce qui produit du flou) — elle hallucine des textures, des bords et des détails fins réalistes basés sur ce qu'elle a appris des images haute résolution d'entraînement.
Pourquoi c'est important : La super résolution a des applications pratiques immédiates : améliorer de vieilles photos, agrandir des textures de jeux vidéo, améliorer des images de caméras de surveillance, préparer des images basse résolution pour l'impression, et comme étape de post-traitement dans les pipelines de génération d'images IA. Real-ESRGAN et des modèles similaires peuvent améliorer drastiquement la qualité d'image en une seule passe d'inférence.
T
Tencent
Hunyuan, WeChat, IA pour le jeu
Compagnies
Géant technologique chinois derrière WeChat, l'une des plus grandes entreprises de jeux vidéo au monde et une force croissante en IA générative. Leurs modèles Hunyuan propulsent des fonctionnalités à travers l'immense écosystème de Tencent qui dessert plus d'un milliard d'utilisateurs.
Pourquoi c’est important : Tencent compte en IA pour la même raison qu'elle compte en tout : l'échelle et la distribution. Avec WeChat qui atteint 1,3 milliard d'utilisateurs et un empire du jeu vidéo couvrant toutes les grandes plateformes, Tencent peut déployer des fonctionnalités IA auprès de plus de gens, plus rapidement, que presque n'importe quelle entreprise au monde. Leurs modèles Hunyuan et notamment HunyuanVideo ont prouvé qu'un laboratoire d'IA de conglomérat peut produire un travail véritablement compétitif, et pas seulement des outils internes fonctionnels. Pour l'écosystème mondial de l'IA, les publications en code ouvert de Tencent en modèles vidéo et de langage ont relevé le plancher de ce qui est librement disponible, et leurs investissements en infrastructure garantissent que les capacités de la Chine en IA demeurent formidables indépendamment des restrictions sur les exportations de puces.
Twelve Labs
Recherche vidéo, Pegasus, Marengo
Compagnies
Entreprise de compréhension vidéo qui permet de rechercher, analyser et générer du contenu à partir de la vidéo en langage naturel. Pensez-y comme à la « génération augmentée par la recherche pour la vidéo » — leurs modèles comprennent ce qui se passe dans une vidéo comme les grands modèles de langage comprennent le texte.
Pourquoi c’est important : Twelve Labs construit l'infrastructure fondamentale pour rendre le contenu vidéo mondial lisible par les machines. À une époque où la vidéo domine la communication numérique mais reste en grande partie non interrogeable par l'IA, leurs modèles de plongement et de génération spécialement conçus résolvent un problème que même les plus grands laboratoires frontière n'ont abordé que superficiellement. Si la vidéo est le médium dominant d'internet, celui qui résout la compréhension vidéo à l'échelle de la production détient une position stratégique comparable à celle que Google Search détient pour le texte.
Tripo
Texte-vers-3D, image-vers-3D
Compagnies
Entreprise d'IA spécialisée dans la génération de modèles 3D à partir de texte ou d'images. Dans un domaine où la plupart de la génération 3D produit des formes inutilisables, Tripo se distingue par la génération de maillages propres et prêts pour la production que les développeurs de jeux et les designers peuvent réellement utiliser.
Pourquoi c’est important : Tripo représente la fine pointe de ce qui rend le contenu 3D généré par IA réellement utilisable en production. Alors que la plupart de la génération 3D par IA produit encore des actifs nécessitant un nettoyage manuel extensif, Tripo s'est concentrée sans relâche sur la qualité des maillages, la topologie appropriée et l'intégration aux flux de travail réels — l'ingénierie peu glamour qui sépare une démonstration de recherche d'un outil pour lequel les professionnels sont prêts à payer. Alors que l'informatique spatiale et la demande de contenu 3D en temps réel explosent, les entreprises qui résoudront en premier la génération de qualité production capteront un marché énorme.
Utiliser l’AI
Un paramètre qui contrôle le degré d'aléatoire ou de déterminisme de la sortie d'un modèle. La température 0 fait que le modèle choisit toujours le prochain token le plus probable (déterministe, focalisé). La température 1+ le rend plus enclin à choisir des tokens moins probables (créatif, imprévisible). La plupart des API utilisent par défaut environ 0,7.
Pourquoi c’est important : La température est le bouton de créativité. Écrire de la fiction? Montez-la. Générer du code ou des réponses factuelles? Baissez-la. C'est l'un des paramètres les plus impactants que vous pouvez ajuster, et expérimenter ne coûte rien.
Fondamentaux
L'unité de base du texte que les modèles d'IA traitent. Un token est typiquement un mot ou un fragment de mot — « understanding » pourrait être un seul token, tandis que « un » + « der » + « standing » pourrait en faire trois. En moyenne, un token représente environ 3/4 d'un mot en anglais. Les modèles lisent, réfléchissent et facturent en tokens.
Pourquoi c’est important : Les tokens sont la monnaie de l'IA. Les fenêtres de contexte se mesurent en tokens. La tarification des API est au token. Quand un fournisseur dit « 1M de contexte », il parle d'un million de tokens, soit environ 750 000 mots. Comprendre les tokens vous aide à estimer les coûts et à optimiser l'utilisation.
Utilisation d'outils
Appel de fonctions
Outils
La capacité d'un modèle d'IA à appeler des fonctions ou des outils externes pendant une conversation. Au lieu de simplement générer du texte, le modèle peut décider de chercher sur le web, exécuter du code, interroger une base de données ou appeler une API — puis incorporer les résultats dans sa réponse. Le modèle produit un « appel d'outil » structuré que l'application hôte exécute.
Pourquoi c’est important : L'utilisation d'outils est ce qui rend les modèles d'IA réellement utiles au-delà de la conversation. C'est le mécanisme derrière les interpréteurs de code, l'IA naviguant sur le web et chaque agent IA. Sans cela, les modèles sont limités à ce qui se trouve dans leurs données d'entraînement.
Modèles
L'architecture de réseau de neurones derrière pratiquement tous les LLM modernes et de nombreux modèles d'image et d'audio. Introduit par Google dans l'article de 2017 « Attention Is All You Need », le Transformer utilise l'auto-attention pour traiter toutes les parties d'une entrée simultanément plutôt que séquentiellement, permettant un parallélisme massif pendant l'entraînement.
Pourquoi c’est important : Les Transformers sont l'architecture qui a rendu le boom actuel de l'IA possible. GPT, Claude, Gemini, Llama, Mistral — ce sont tous des Transformers sous le capot. Comprendre cette architecture vous aide à comprendre pourquoi les modèles ont les capacités et les limitations qu'ils ont.
Tokenizer
Tokenisation
L'algorithme qui convertit du texte brut en tokens avant qu'un modèle puisse le traiter. Un tokenizer maintient un vocabulaire fixe de types de tokens et découpe n'importe quel texte d'entrée en une séquence de ces tokens. Différents modèles utilisent différents tokenizers — la même phrase se tokenise différemment pour Claude, GPT et Llama.
Pourquoi c'est important : Le tokenizer est la couche invisible entre ton texte et le modèle. Il détermine combien de tokens ton prompt coûte, pourquoi certaines langues sont plus chères que d'autres, et pourquoi le code consomme parfois le contexte plus vite que la prose.
Utiliser les connaissances apprises d'une tâche ou d'un jeu de données pour améliorer la performance sur une tâche différente mais liée. Au lieu d'entraîner à partir de zéro chaque fois, tu commences avec un modèle qui comprend déjà des patterns généraux (structure du langage, caractéristiques visuelles) et tu l'adaptes à ton besoin spécifique. Le pré-entraînement suivi d'un ajustement fin est le paradigme dominant en IA moderne.
Pourquoi c'est important : L'apprentissage par transfert est la raison pour laquelle l'IA est devenue pratique. Entraîner un modèle de langage à partir de zéro coûte des millions de dollars. Ajuster finement un modèle pré-entraîné sur ta tâche spécifique coûte quelques dizaines de dollars et quelques heures. Cette économie est ce qui a permis l'explosion des applications d'IA — tu n'as pas besoin du budget de Google pour construire quelque chose d'utile.
Débit
Tokens par seconde, TPS
Le nombre total de tokens qu'un système peut générer par seconde à travers toutes les requêtes concurrentes. Distinct de la latence (la rapidité avec laquelle une requête individuelle est servie). Un système avec un haut débit sert de nombreux utilisateurs simultanément. Un système avec une faible latence sert chaque utilisateur individuel rapidement. Les deux s'opposent souvent.
Pourquoi c'est important : Quand tu construis des produits IA, le débit détermine tes coûts de service et ta capacité. Un système qui génère 100 tokens/seconde par utilisateur mais ne peut servir qu'un seul utilisateur à la fois a un faible débit même si la latence individuelle est excellente. Le débit est ce que tu optimises quand tu paies des factures GPU pour des milliers d'utilisateurs concurrents.
Une plateforme cloud pour exécuter et entraîner des modèles d'IA open-source. Together AI fournit des API d'inférence pour des modèles ouverts populaires (Llama, Mistral, Qwen, etc.) à des prix compétitifs, plus de l'infrastructure d'ajustement fin et d'entraînement personnalisé. Fondée par des chercheurs en IA, ils contribuent aussi à la recherche open-source et ont publié leurs propres modèles.
Pourquoi c'est important : Together AI est la principale alternative à l'auto-hébergement pour les équipes qui veulent utiliser des modèles ouverts. Au lieu de gérer tes propres serveurs GPU et ton infrastructure de service de modèles, tu appelles leur API et tu obtiens Llama-70B ou Mistral à une fraction des prix d'OpenAI/Anthropic. Ils représentent la couche « cloud pour modèles ouverts » de la pile IA qui rend les modèles à poids ouverts pratiques pour l'utilisation en production.
Résumé de texte
Résumé automatique, TL;DR
Utiliser l'AI
Générer automatiquement une version plus courte d'un texte qui préserve les informations clés. Le résumé extractif sélectionne et combine les phrases existantes les plus importantes. Le résumé abstractif génère de nouvelles phrases qui capturent le sens — comme un humain résumerait. Les LLM modernes excellent dans le résumé abstractif, produisant des résumés fluides et précis de documents, articles et conversations.
Pourquoi c'est important : La surcharge informationnelle est le défi majeur de l'ère numérique. Le résumé aide : condenser de longs rapports en synthèses exploitables, générer des notes de réunion à partir de transcriptions, créer des résumés pour les articles de recherche, et produire des versions TL;DR d'articles longs. C'est l'une des capacités LLM les plus immédiatement utiles et l'une des plus faciles à intégrer dans les flux de travail existants.
Tenseur
Tableau multidimensionnel
Fondamentaux
Un tableau multidimensionnel de nombres — la structure de données fondamentale en deep learning. Un scalaire est un tenseur 0D (un seul nombre). Un vecteur est un tenseur 1D. Une matrice est un tenseur 2D. Une image est un tenseur 3D (hauteur × largeur × canaux). Un lot d'images est un tenseur 4D. Les poids du modèle, les activations, les gradients — tout dans un réseau de neurones est un tenseur.
Pourquoi c'est important : Les tenseurs sont le langage du deep learning. PyTorch, TensorFlow et JAX sont fondamentalement des bibliothèques de calcul tensoriel. Comprendre les formes et opérations de tenseurs est essentiel pour lire le code de modèles, déboguer les erreurs de forme (l'erreur la plus courante dans le code ML), et comprendre ce qui se passe à l'intérieur des réseaux de neurones. Si tu peux suivre les formes de tenseurs, tu peux suivre l'architecture.
Transfert de style
Neural Style Transfer, transfert de style neuronal
Utiliser l'AI
Appliquer le style visuel d'une image (une peinture, une photographie, un design) au contenu d'une autre image. « Fais que cette photo ressemble à un tableau de Van Gogh » — c'est du transfert de style. Le transfert de style neuronal utilise des réseaux profonds pour séparer le contenu (ce qui est dans l'image) du style (comment ça se présente) et les recombiner.
Pourquoi c'est important : Le transfert de style a été l'une des premières applications virales d'art IA et reste largement utilisé dans les applications de retouche photo, les filtres de réseaux sociaux et les outils créatifs. Le comprendre t'aide à saisir comment les réseaux de neurones représentent les caractéristiques visuelles à différents niveaux d'abstraction — le même insight qui alimente la génération d'images moderne.
Tests A/B pour l'IA
Évaluation en ligne, split testing
Infrastructure
Comparer deux variantes d'un système IA (différents modèles, prompts ou configurations) en assignant aléatoirement de vrais utilisateurs à chaque variante et en mesurant laquelle performe mieux sur les métriques qui comptent. Contrairement à l'évaluation hors ligne (benchmarks, jeux de test), les tests A/B révèlent comment les changements affectent le comportement réel des utilisateurs — engagement, satisfaction, complétion de tâches et revenus.
Pourquoi c'est important : Les métriques hors ligne ne prédisent pas toujours la performance réelle. Un modèle qui score plus haut sur les benchmarks pourrait produire des réponses que les utilisateurs apprécient moins. Un changement de prompt qui améliore la qualité pourrait augmenter la latence au point que les utilisateurs abandonnent. Les tests A/B sont le seul moyen de savoir si un changement améliore réellement l'expérience utilisateur. C'est comme ça que chaque produit IA majeur prend ses décisions de déploiement.
U
Upstage
Modèles Solar, Document AI
Compagnies
Entreprise coréenne d'IA connue pour sa famille de modèles Solar et ses produits Document AI. A démontré que des modèles plus petits et bien entraînés peuvent surpasser des modèles beaucoup plus grands — leur Solar 10.7B a largement dépassé sa catégorie de poids sur les bancs d'essai internationaux.
Pourquoi c’est important : Upstage a démontré qu'on n'a pas besoin de cent milliards de paramètres pour construire un modèle de langage de classe mondiale. Le succès de Solar 10.7B en tête des bancs d'essai ouverts a remis en question le discours dominant selon lequel « la mise à l'échelle est tout ce dont on a besoin » et a montré que des techniques d'entraînement astucieuses pouvaient compenser la taille brute. Au-delà des modèles, le travail d'Upstage en Document AI comble l'une des lacunes les plus pratiques de l'écosystème IA — transformer des documents réels désordonnés en données structurées — et leur succès depuis Séoul prouve que de l'innovation significative en IA se produit bien au-delà des corridors de la Silicon Valley et de Beijing qui dominent les manchettes.
Une approche d'entraînement où le modèle trouve des patterns dans les données sans qu'on lui dise quoi chercher. Pas de labels, pas de bonnes réponses — juste des données brutes et un modèle qui découvre la structure.
Pourquoi c'est important : La plupart des données du monde réel ne sont pas étiquetées. L'apprentissage non supervisé trouve des patterns impossibles à découvrir manuellement. C'est aussi la base des embeddings.
V
Vision
Vision multimodale, compréhension d'images
Utiliser l'IA
La capacité d'un modèle de langage à comprendre et raisonner sur des images en même temps que du texte. Tu envoies une photo et tu demandes « qu'est-ce qu'il y a dans cette image? » ou tu téléverses un graphique et tu demandes « résume les tendances ». Les modèles capables de vision (Claude, GPT-4V, Gemini) encodent les images en tokens que le modèle de langage traite aux côtés des tokens textuels, permettant un raisonnement unifié texte-image.
Pourquoi c'est important : La vision transforme ce que les LLM peuvent faire. Au lieu de décrire un bogue en mots, tu le captures en screenshot. Au lieu de taper un tableau, tu le photographies. Au lieu d'expliquer un diagramme, tu le partages. La vision rend l'IA accessible pour les tâches où le texte seul est insuffisant — c'est-à-dire la plupart des tâches du monde réel. C'est la capacité multimodale la plus impactante pour l'utilisateur au quotidien.
Vocabulaire
Vocab, vocabulaire de tokens
Fondamentaux
L'ensemble fixe de tokens qu'un modèle peut reconnaître et produire. Un vocabulaire est construit par le tokenizer pendant l'entraînement et contient typiquement de 32K à 128K entrées — des mots courants, des fragments de sous-mots, des caractères individuels et des tokens spéciaux. Tout texte que le modèle traite doit pouvoir s'exprimer comme une séquence de tokens de ce vocabulaire. Les tokens absents du vocabulaire sont découpés en morceaux plus petits qui, eux, y figurent.
Pourquoi c'est important : Le vocabulaire détermine ce que le modèle peut « voir ». Un vocabulaire entraîné principalement sur l'anglais traitera l'anglais efficacement (un token par mot) mais fragmentera le chinois, l'arabe ou le code en beaucoup de petits tokens (coûteux, plus lent, moins de contexte). La conception du vocabulaire est l'une des décisions les plus lourdes de conséquences et les moins discutées dans le développement de modèles.
IA vocale
IA de la parole, IA conversationnelle
Outils
Les systèmes d'IA pour générer, comprendre et manipuler la parole humaine. Cela inclut la synthèse vocale (TTS), la reconnaissance vocale (STT/ASR), le clonage vocal, la traduction vocale en temps réel, la détection d'émotions dans la parole et les agents vocaux conversationnels. Le domaine a progressé au point où la parole générée par IA est souvent indiscernable de la parole humaine.
Pourquoi c’est important : La voix est l'interface humaine la plus naturelle, et l'IA la rend enfin programmable. La voix IA propulse tout, des robots de service à la clientèle à la narration de livres audio en passant par la transcription de réunions en temps réel. Les implications éthiques du clonage vocal — consentement, identité, fraude — en font l'un des domaines les plus sensibles de l'IA.
Vidu
Génération vidéo Vidu, cohérence longue durée
Compagnies
Plateforme de génération vidéo de Shengshu Technology, produisant certaines des vidéos générées par IA les plus physiquement cohérentes. A attiré l'attention pour la qualité de mouvement solide et la cohérence multi-plans qui rivalise avec les concurrents occidentaux.
Pourquoi c’est important : Vidu a démontré que les laboratoires chinois d'IA pouvaient égaler la qualité de génération vidéo occidentale en quelques mois seulement après la révélation de Sora, reformulant les hypothèses sur l'endroit où se situe réellement la fine pointe en vidéo IA. Leur accent sur la cohérence physique et la cohérence multi-plans a fait avancer tout le domaine, forçant les concurrents à prioriser le réalisme plutôt que le simple attrait visuel. Pour le marché plus large de la vidéo IA, la tarification agressive de Vidu et la disponibilité de son API ont également contribué à faire baisser les coûts et à accroître l'accès pour les développeurs du monde entier.
Voyage AI
voyage-3, embeddings spécifiques au domaine
Compagnies
Entreprise de modèles de plongement construisant des vecteurs spécialisés pour le code, le juridique, la finance et la recherche multilingue. Leurs modèles se classent systématiquement en tête du classement MTEB, offrant l'une des meilleures qualités de recherche disponibles via API.
Pourquoi c’est important : Voyage AI a prouvé que les plongements méritent la même attention et le même investissement en ingénierie que les grands modèles de langage. Dans un marché où la plupart des fournisseurs traitent les représentations vectorielles comme un utilitaire à faible marge, Voyage a démontré que des modèles de plongement spécifiques par domaine peuvent améliorer de manière significative la précision de la recherche — le levier le plus important dans les systèmes de génération augmentée par la recherche en production. Leur acquisition par Google a validé la thèse que celui qui possède la couche de plongement possède les fondations de l'infrastructure de recherche IA.
Base de données vectorielle
Qdrant, Pinecone, Weaviate, ChromaDB
Outils
Une base de données optimisée pour le stockage et la recherche d'embeddings (vecteurs). Au lieu de faire correspondre des mots-clés exacts comme une base de données traditionnelle, les bases de données vectorielles trouvent les éléments les plus sémantiquement similaires. Vous demandez « comment corriger une fuite de mémoire » et elle retourne des documents sur « déboguer la consommation de RAM » parce que les embeddings sont proches.
Pourquoi c’est important : Les bases de données vectorielles sont la couche de stockage qui fait fonctionner le RAG. Sans elles, il faudrait convertir en embedding toute votre base de connaissances à chaque requête. Elles sont aussi l'épine dorsale des systèmes de recommandation et de la recherche sémantique.
VRAM
Mémoire vidéo, mémoire GPU
Infrastructure
La mémoire d'un GPU, distincte de la RAM système. Les modèles d'IA doivent tenir dans la VRAM pour tourner sur un GPU. Un modèle de 7 milliards de paramètres en précision 16 bits a besoin d'environ 14 Go de VRAM. Les GPU grand public ont de 8 à 24 Go; les GPU de centre de données (A100, H100) ont de 40 à 80 Go. La VRAM est presque toujours le goulot d'étranglement pour l'IA locale.
Pourquoi c’est important : La VRAM détermine quels modèles vous pouvez exécuter. C'est pourquoi la quantification existe (pour réduire les modèles afin qu'ils tiennent), pourquoi les modèles MoE sont complexes (tous les experts doivent tenir dans la VRAM), et pourquoi les prix des GPU augmentent si fortement avec la mémoire. « Est-ce que ça rentre dans la VRAM? » est la première question de l'auto-hébergement d'IA.
Génération de vidéos
Text-to-video, vidéo IA
Fondamentaux
Créer des vidéos à partir de descriptions textuelles, d'images ou d'autres vidéos en utilisant des modèles d'IA. Sora (OpenAI), Kling (Kuaishou), Runway Gen-3, Vidu et d'autres génèrent des vidéos à partir de prompts comme « un plan drone survolant un récif corallien ». La technologie étend la génération d'images à la dimension temporelle, ajoutant le défi de maintenir la cohérence entre les images et de générer un mouvement réaliste.
Pourquoi c’est important : La génération de vidéos est la frontière de l'IA générative — la modalité la plus difficile et celle avec le plus grand potentiel commercial. Elle commence à transformer le cinéma, la publicité, les réseaux sociaux et l'éducation. L'écart de qualité entre l'IA et la vidéo professionnelle se réduit rapidement, les modèles actuels produisant des clips de 5 à 15 secondes parfois indiscernables de vraies séquences.
Modèles
Une architecture Transformer appliquée aux images en découpant une image en patches de taille fixe (ex : 16×16 pixels), en traitant chaque patch comme un "token", et en traitant la séquence de patches avec l'attention standard du Transformer. ViT (Dosovitskiy et al., 2020) a montré que les Transformers pouvaient égaler ou surpasser les CNN sur les tâches d'image quand ils sont entraînés sur suffisamment de données, unifiant les architectures pour le langage et la vision.
Pourquoi c’est important : ViT a prouvé que le Transformer est une architecture universelle — pas seulement pour le texte mais aussi pour les images. Cette unification a permis l'explosion des modèles multimodaux : si les images et le texte sont tous deux des séquences de tokens traités par la même architecture, les combiner devient naturel. ViT est l'encodeur d'images dans CLIP, l'épine dorsale de DiT, et le fondement de la vision par ordinateur moderne.
Outils
Un moteur de serving LLM open-source qui atteint un haut débit grâce à PagedAttention et au batching continu. vLLM gère l'ingénierie complexe de la gestion de la mémoire GPU, l'ordonnancement des requêtes et l'optimisation du KV cache, fournissant une API compatible OpenAI qui facilite l'auto-hébergement de modèles ouverts (Llama, Mistral, Qwen) en production.
Pourquoi c’est important : vLLM est la solution de serving LLM open-source la plus populaire. Si tu héberges un modèle ouvert, tu utilises probablement vLLM (ou tu devrais). Son innovation PagedAttention a augmenté le débit de serving de 2–24x par rapport aux implémentations naïves. C'est la couche d'infrastructure qui rend les modèles ouverts pratiques pour un usage en production.
Clonage vocal
Synthèse vocale, Réplication de voix
Utiliser l'AI
Créer une copie synthétique de la voix d'une personne spécifique à partir d'un court échantillon audio, permettant la synthèse vocale qui sonne comme cette personne. Les systèmes modernes (ElevenLabs, PlayHT, Resemble AI) peuvent cloner une voix à partir d'aussi peu que 15 secondes d'audio avec une fidélité remarquable, capturant le ton, l'accent, le style de parole et l'étendue émotionnelle.
Pourquoi c'est important : Le clonage vocal permet des applications créatives et d'accessibilité puissantes : doubler des films dans la propre voix de l'acteur à travers les langues, préserver les voix de personnes perdant leur capacité de parler (patients SLA), créer des voix de marque cohérentes, et personnaliser les assistants IA. Ça crée aussi des risques sérieux : arnaques téléphoniques imitant des membres de la famille, faux audio de personnalités publiques, et réplication vocale non consentie.
Ensemble de validation
Ensemble de développement, Ensemble de rétention
Entraînement
Un sous-ensemble de données tenu à l'écart de l'entraînement, utilisé pour évaluer la performance du modèle pendant le développement et ajuster les hyperparamètres. La division en trois parties : l'ensemble d'entraînement entraîne le modèle, l'ensemble de validation guide les décisions sur le modèle (taux d'apprentissage, architecture, quand arrêter), et l'ensemble de test fournit l'estimation finale et non biaisée de la performance. L'ensemble de validation est ton miroir pendant le développement.
Pourquoi c'est important : Sans un ensemble de validation, tu navigues à l'aveugle. La perte d'entraînement te dit à quel point le modèle s'ajuste aux données d'entraînement, mais pas à quel point il généralise. L'ensemble de validation répond à la question qui compte vraiment : « comment ce modèle performera-t-il sur des données qu'il n'a pas vues? » Chaque décision pendant le développement du modèle — hyperparamètres, choix d'architecture, durée d'entraînement — devrait être évaluée sur l'ensemble de validation.
Validation croisée
K-Fold CV, Leave-One-Out
Entraînement
Une technique pour évaluer la performance d'un modèle quand tu n'as pas assez de données pour un jeu de test séparé. La validation croisée K-fold divise les données en K parties égales, entraîne sur K−1 parties et évalue sur la partie restante, en effectuant une rotation K fois pour que chaque point de données soit utilisé à la fois pour l'entraînement et l'évaluation. Le score moyen sur tous les K folds donne une estimation de performance plus fiable qu'un seul découpage entraînement/test.
Pourquoi c'est important : La validation croisée est essentielle quand les données sont rares — si tu n'as que 500 exemples, en mettre 100 de côté pour les tests signifie s'entraîner sur 20 % de données en moins. La validation croisée utilise toutes les données à la fois pour l'entraînement et l'évaluation. Elle te donne aussi un intervalle de confiance (variance entre les folds) plutôt qu'un seul chiffre, te disant à quel point la performance de ton modèle est stable.
Visualisation de l'attention
Cartes d'attention, heatmap d'attention
Fondamentaux
Visualiser ce à quoi un modèle Transformer « prête attention » en affichant les poids d'attention sous forme de heatmaps. Pour chaque token de requête, la carte d'attention montre combien de poids il attribue à chaque autre token. Des poids élevés (points lumineux) indiquent une forte attention — le modèle considère ces tokens comme très pertinents pour le calcul en cours.
Pourquoi c'est important : La visualisation de l'attention est la manière la plus intuitive de regarder à l'intérieur d'un Transformer et comprendre son raisonnement. Quand un modèle traduit « le chat noir » en « the black cat », les cartes d'attention montrent que « black » prête fortement attention à « noir » et « cat » à « chat ». Ça aide à débuguer le comportement du modèle, comprendre les échecs, et construire une intuition sur le fonctionnement de l'attention.
W
Poids
Poids de modèle, poids du réseau de neurones
Entraînement
Les valeurs numériques à l'intérieur d'un réseau neuronal qui sont ajustées pendant l'entraînement afin de minimiser l'erreur. Chaque connexion entre les neurones a un poids qui détermine dans quelle mesure un neurone influence le suivant. Lorsque vous téléchargez un fichier de modèle — un fichier .safetensors, .gguf ou .pt —, vous téléchargez ses poids. « Libérer les poids » signifie publier ces fichiers afin que quiconque puisse exécuter le modèle. Les poids SONT le modèle; tout le reste n'est que l'architecture qui vous indique comment les organiser.
Pourquoi c’est important : Lorsque l'industrie de l'intelligence artificielle parle de « poids ouverts » vs « open source », la distinction est importante. Les poids seuls vous permettent de faire fonctionner et d'affiner un modèle, mais sans le code d'entraînement, les données et la recette, vous ne pouvez pas le reproduire à partir de zéro. Comprendre les poids vous aide à saisir la distribution du modèle, la quantification (réduction de la précision des poids) et pourquoi un modèle de 7B nécessite ~14 Go d'espace disque en fp16.
Wan-AI
Modèles vidéo Wan, génération vidéo en poids ouverts
Compagnies
Initiative dédiée à la génération vidéo d'Alibaba, publiant des modèles vidéo de haute qualité à poids ouverts. Fait partie de la stratégie plus large d'Alibaba visant à mener en IA à code ouvert dans toutes les modalités.
Pourquoi c’est important : Wan-AI a fondamentalement changé l'accessibilité de la génération vidéo de haute qualité en publiant des modèles à poids ouverts que n'importe qui peut exécuter, affiner et déployer sans frais de licence. Cela a forcé toute l'industrie de la vidéo IA à reconsidérer la proposition de valeur des modèles à code source fermé et a accéléré l'innovation dans tout l'écosystème. En tant qu'élément de la stratégie d'IA à code ouvert plus large d'Alibaba aux côtés de Qwen, Wan représente un argument crédible selon lequel les publications à poids ouverts des grandes entreprises technologiques peuvent égaler ou dépasser ce que des entreprises en démarrage bien financées produisent derrière des portes closes.
Filigrane IA
Watermark IA
Signaux invisibles dans le contenu IA pour permettre la détection. Texte : biaise la sélection de tokens statistiquement. Image : patterns de pixels invisibles.
Pourquoi c'est important : Une des rares approches pour distinguer le contenu IA à grande échelle. Important pour la désinformation et l'intégrité académique.
La plateforme MLOps dominante pour le suivi des expériences d'apprentissage automatique. W&B te permet de journaliser les métriques, hyperparamètres, sorties de modèles et performances système pendant l'entraînement, puis de comparer les exécutions visuellement. C'est devenu l'outil standard pour les chercheurs et ingénieurs ML pour suivre ce qu'ils ont essayé, ce qui a marché et pourquoi — essentiellement du contrôle de version pour les expériences.
Pourquoi c'est important : Sans suivi des expériences, le développement ML est le chaos : quels hyperparamètres ont produit ce bon résultat? Quelle version du jeu de données a été utilisée? Pourquoi l'entraînement a-t-il divergé? W&B a tellement bien résolu ce problème que c'est maintenant utilisé par la plupart des labos d'IA, des chercheurs solo à OpenAI. Si tu entraînes des modèles, tu utilises presque certainement W&B ou quelque chose inspiré par lui.
Initialisation des poids
Xavier Init, Kaiming Init, He Init
Entraînement
Comment les poids du réseau de neurones sont fixés avant que l'entraînement ne commence. Une mauvaise initialisation peut faire échouer l'entraînement avant même qu'il ne commence (activations qui s'évanouissent ou explosent). Une bonne initialisation assure que les activations et gradients maintiennent des magnitudes raisonnables à travers les couches. L'initialisation Xavier (pour tanh/sigmoid) et l'initialisation Kaiming/He (pour ReLU) sont les standards, chacune calibrée pour la fonction d'activation.
Pourquoi c'est important : L'initialisation semble être un détail mineur mais c'est critique pour l'entraînement de réseaux profonds. Un réseau avec des poids initiaux aléatoires (trop grands) produit des activations qui explosent. Un avec des poids trop petits produit des activations qui s'évanouissent. Une initialisation correcte place le réseau dans une « zone Goldilocks » où les signaux traversent sans exploser ni s'évanouir — un prérequis pour que la descente de gradient fonctionne.
Windsurf
Codeium, Windsurf Editor
Compagnies
Un éditeur de code natif IA (anciennement Codeium) qui concurrence Cursor dans l'espace des assistants de codage IA. Comme Cursor, Windsurf est construit comme un fork de VS Code avec une intégration IA profonde : édition multi-fichiers, suggestions contextuelles à la base de code, et commandes en langage naturel. L'entreprise met l'accent sur les « flows » — des interactions IA en plusieurs étapes qui maintiennent le contexte à travers les modifications.
Pourquoi c'est important : Windsurf représente la concurrence croissante dans les outils de codage IA, prouvant que le marché des éditeurs natifs IA est assez grand pour plusieurs acteurs. Sa fonctionnalité « Cascade » pour les tâches de codage en plusieurs étapes et son plan gratuit ont attiré une base d'utilisateurs significative. La compétition Cursor vs Windsurf vs Copilot vs Claude Code stimule l'innovation rapide dans la façon dont les développeurs interagissent avec l'IA.
X
Xiaomi
MiLM, IA pour l'électronique grand public
Compagnies
L'une des plus grandes entreprises d'électronique grand public au monde, qui développe désormais ses propres modèles d'IA. MiLM propulse des fonctionnalités à travers l'écosystème Xiaomi de téléphones, d'appareils de maison intelligente et de véhicules électriques — l'IA pour le prochain milliard d'utilisateurs.
Pourquoi c’est important : Xiaomi représente l'argument le plus convaincant sur la manière dont l'IA atteindra le prochain milliard d'utilisateurs — non pas par des applications de chatbot autonomes ou des API pour développeurs, mais intégrée invisiblement dans les appareils que les gens possèdent déjà. Avec des centaines de millions d'appareils actifs couvrant téléphones, objets connectés portables, appareils ménagers et désormais véhicules électriques, Xiaomi peut déployer l'IA à une échelle et avec une intimité que les entreprises d'IA pures ne peuvent égaler. Leur approche « écosystème d'abord » est un aperçu de la façon dont l'IA deviendra une infrastructure ambiante plutôt qu'un produit qu'on choisit consciemment d'utiliser, et leur dominance dans les marchés émergents signifie que cet avenir atteindra des populations auxquelles les laboratoires d'IA frontière pensent rarement.
xAI
Grok
L'entreprise d'IA d'Elon Musk (2023). Modèles Grok, accès aux données de X, cluster Colossus (100K+ H100).
Pourquoi c'est important : L'échelle + des données uniques. Que le firehose de X et un calcul massif produisent des modèles de qualité frontière, c'est la question ouverte.
Y
YAML
YAML Ain't Markup Language
Infrastructure
Un format de sérialisation de données lisible par les humains utilisé de manière extensive dans l'intelligence artificielle et le DevOps pour les fichiers de configuration, les définitions de pipeline et les métadonnées des modèles. YAML utilise l'indentation pour représenter la structure (aucuns crochets ou accolades), ce qui en fait un format facile à lire, mais réputé pour être sensible à l'espace blanc. On le trouve partout dans les workflows d'intelligence artificielle — les fichiers Docker Compose, les manifestes Kubernetes, les fiches de modèles Hugging Face, les pipelines CI/CD et les fichiers de configuration d'entraînement.
Pourquoi c’est important : Si vous travaillez avec l'infrastructure d'intelligence artificielle, vous rédigez du YAML. Les configurations de modèles, les manifestes de déploiement, les définitions de pipeline, les variables d'environnement — c'est le langage de liaison du stack d'intelligence artificielle moderne. Il n'est pas optionnel de s'y familiariser; c'est la première chose qui casse lorsqu'on malconfigure une course d'entraînement ou un déploiement.
Z
Zhipu AI
GLM, ChatGLM, CogView, CogVideo
Compagnies
Entreprise d'IA chinoise issue de l'Université Tsinghua. Derrière la famille de modèles GLM et l'une des principales plateformes d'IA en Chine, avec des forces en génération textuelle et visuelle.
Pourquoi c’est important : Zhipu AI fait le pont entre la recherche académique et l'IA commerciale en Chine, produisant des modèles libres — en particulier en génération vidéo avec CogVideoX — qui ont connu une adoption véritablement mondiale. Leur architecture GLM et leurs racines à Tsinghua leur confèrent une crédibilité technique profonde, faisant de Zhipu l'une des rares entreprises d'IA chinoises dont les contributions à la recherche sont largement citées et utilisées comme fondement à l'échelle internationale.
Zero-shot / Few-shot
Apprentissage en contexte
Utiliser l’AI
Zero-shot signifie demander à un modèle d'effectuer une tâche sans aucun exemple — juste l'instruction. Few-shot signifie fournir quelques exemples entrée-sortie dans le prompt avant la requête réelle. « Voici 3 exemples de comment formater ces données... maintenant faites celui-ci. » Le modèle apprend le patron à partir du contexte seul, sans entraînement requis.
Pourquoi c’est important : Le prompting few-shot est le moyen le plus rapide d'enseigner un nouveau format ou comportement à un modèle. Besoin d'une sortie JSON cohérente? Montrez-lui trois exemples. Besoin d'un style d'écriture spécifique? Donnez-lui des échantillons. C'est gratuit, instantané et étonnamment puissant.
GPT
ChatGPT, GPT-4, GPT-5
Modèles
GPT (Generative Pre-trained Transformer) est la famille de grands modèles de langage d'OpenAI : des transformers à décodeur seul entraînés à prédire le token suivant, puis alignés pour le dialogue et le raisonnement. La lignée va du GPT-1 de 117 millions de paramètres (2018) jusqu'à GPT-5 (août 2025), en passant par GPT-4 et le multimodal GPT-4o, et elle alimente à la fois le produit ChatGPT et l'API OpenAI.
Pourquoi c’est important : GPT est la famille qui a fait entrer les grands modèles de langage dans le grand public : ChatGPT a atteint environ 100 millions d'utilisateurs dans les deux mois suivant son lancement, et l'API est devenue l'infrastructure par défaut de toute une génération de produits. La trajectoire de la famille — mise à l'échelle, RLHF, multimodalité, raisonnement au moment du test — est en fait une histoire condensée du développement des LLM modernes, si bien que comprendre GPT est un raccourci pour comprendre le domaine.
Claude
Claude Sonnet, Claude Opus, Claude Haiku
Modèles
Claude est une famille de grands modèles de langage développée par Anthropic, déclinée en trois niveaux — Haiku, Sonnet et Opus — qui font varier la vitesse et le coût en fonction des capacités. Elle est disponible sous forme d'assistant conversationnel, d'API et d'ensemble d'outils agentiques, et elle est entraînée avec la méthode d'IA constitutionnelle d'Anthropic, qui intègre des principes de comportement dans le processus d'entraînement au lieu de s'appuyer uniquement sur la rétroaction humaine.
Pourquoi c’est important : Claude figure sur la liste restreinte des familles de modèles frontière que les praticiens évaluent pour un travail sérieux, avec une réputation particulièrement forte en codage, en analyse de longs documents et en qualité d'écriture. Sa gamme échelonnée permet d'adapter le coût à la difficulté de la tâche sur une seule API, et son accent sur un comportement prévisible et pilotable en fait un choix par défaut courant dans les produits d'entreprise où les surprises coûtent cher.
Gemini
Google Gemini, Bard
Modèles
La famille phare de grands modèles de langage de Google, développée par Google DeepMind comme successeur de PaLM et du chatbot Bard. Les modèles sont nativement multimodaux — entraînés dès le départ sur du texte, des images, de l'audio et de la vidéo — et vont de la déclinaison Nano embarquée sur l'appareil jusqu'à Ultra à l'échelle des centres de données. Le nom désigne aussi l'application grand public d'IA de Google, que ces modèles alimentent.
Pourquoi c’est important : Gemini est la réponse de Google à la série GPT d'OpenAI et à Claude d'Anthropic, et il est intégré à des produits — Search, Android, Gmail, Docs — que des milliards de personnes utilisent déjà. Pour les développeurs, ses traits distinctifs sont une très grande fenêtre de contexte, une multimodalité native et une tarification agressive sur la gamme rapide Flash. Si vous livrez quoi que ce soit dans l'écosystème Google, Gemini est le modèle par défaut auquel votre travail sera comparé.
Llama
Meta Llama
Modèles
Une famille de grands modèles de langage de Meta dont les poids sont téléchargeables gratuitement sous une licence communautaire personnalisée. Déclinée en tailles de 1B à 405B de paramètres sur quatre générations majeures, elle est devenue le point de départ par défaut pour l'ajustement fin, l'inférence locale et la recherche ouverte. Le nom signifiait à l'origine Large Language Model Meta AI.
Pourquoi c’est important : Parce que tout le monde peut télécharger les poids, Llama est l'ancre de l'écosystème des modèles ouverts : les outils d'inférence locale, des milliers de variantes ajustées et une large part des produits d'IA commerciaux en dérivent. C'est aussi la référence à laquelle tout autre modèle à poids ouverts est comparé, donc connaître la gamme Llama revient à savoir où se situe la frontière ouverte.
Qwen
Tongyi Qianwen
Modèles
Qwen est une famille de grands modèles de langage à poids ouverts développée par Alibaba Cloud. La gamme couvre plusieurs générations — Qwen 1.5, 2, 2.5 et 3 — avec des tailles allant d'un demi-milliard à des centaines de milliards de paramètres, dans des conceptions denses comme à mélange d'experts. La plupart des versions sont publiées sous la permissive licence Apache 2.0, ce qui permet de les exécuter, de les modifier et de les déployer commercialement sans redevance d'utilisation.
Pourquoi c’est important : Qwen est l'une des meilleures familles à poids ouverts disponibles, ce qui en fait un point de départ par défaut pour les équipes qui veulent un modèle performant qu'elles peuvent exécuter ou ajuster elles-mêmes au lieu de payer des frais d'API au token. Ses modèles sont particulièrement bons en multilingue, en programmation et en mathématiques, et l'éventail des tailles fait qu'il existe généralement une variante adaptée à un budget GPU donné. Comme les poids sont téléchargeables, un modèle Qwen peut aussi servir de base à votre propre modèle spécialisé, et pas seulement d'endpoint que l'on appelle.
Grok
xAI Grok
Modèles
Grok est la famille de grands modèles de langage développée par xAI, l'entreprise d'intelligence artificielle d'Elon Musk, et le nom du chatbot assistant que ces modèles alimentent. Il se distingue par une intégration profonde avec le réseau social X, qui lui donne un accès en temps réel aux publications publiques, et par une posture délibérément plus souple que celle des assistants rivaux sur les restrictions de contenu.
Pourquoi c’est important : Grok montre jusqu'où l'échelle de calcul et la vitesse peuvent mener un entrant tardif : xAI est passée de sa création à une lignée crédible de modèles frontière en environ deux ans, en grande partie en construisant l'un des plus grands clusters d'entraînement au monde. C'est aussi l'assistant IA par défaut de la base d'utilisateurs de X, et sa publication de Grok-1 en poids ouverts reste l'un des plus grands modèles de langage jamais publiés sous licence permissive.
Gemma
Google Gemma, Gemma 3
Modèles
La famille de modèles de langage en poids ouverts de Google, créée par Google DeepMind à partir des mêmes recherches et technologies que celles derrière Gemini. Les modèles Gemma sont petits par choix de conception — de 1 à 27 milliards de paramètres — et sont distribués sous forme de poids téléchargeables, de sorte que n'importe qui peut les exécuter, les ajuster et les déployer sur son propre matériel au lieu d'appeler une API hébergée.
Pourquoi c’est important : Gemma met la qualité d'entraînement d'un laboratoire de pointe dans des modèles qui tiennent sur un portable, un téléphone ou un seul GPU, ce qui en fait un point de départ par défaut pour l'ajustement fin, le prototypage et l'IA sur appareil. Comme les poids sont gratuits et que la licence permet l'usage commercial, une équipe peut lancer un produit sur Gemma sans frais d'API par token et sans envoyer les données de ses utilisateurs à un tiers.
Phi
Microsoft Phi
Modèles
La famille de petits modèles de langage de Microsoft, allant d'environ 1 à 14 milliards de paramètres, conçue pour offrir une forte capacité de raisonnement et de programmation à des tailles qui s'exécutent sur un portable ou un téléphone. Les modèles Phi sont entraînés principalement sur du texte web soigneusement filtré et sur des données synthétiques générées par un modèle de langage plutôt que sur l'échelle brute d'Internet, ce qui leur permet de rivaliser avec des modèles bien plus gros sur les bancs d'essai de mathématiques, de code et de raisonnement.
Pourquoi c’est important : Phi est la preuve phare que la qualité d'un modèle n'est pas seulement fonction du nombre de paramètres : un Phi de 3,8 milliards de paramètres peut égaler des modèles plusieurs fois plus gros sur des tâches de raisonnement tout en coûtant une fraction du prix à servir. Comme les poids sont publiés ouvertement sous la licence permissive MIT, Phi est devenu un choix par défaut pour les applications sur appareil, les outils hors ligne et les déploiements sensibles aux coûts.
Sora
OpenAI Sora
Modèles
Sora est la famille de modèles de génération vidéo d'OpenAI, qui crée de courts clips vidéo à partir de prompts textuels ou d'images fixes. Présenté d'abord en démonstration en février 2024 et rendu accessible aux abonnés sous le nom de Sora Turbo en décembre 2024, il combine un processus de diffusion avec une ossature transformer pour produire des séquences cohérentes dans le temps. Une deuxième génération, Sora 2, est arrivée à la fin de 2025 avec de l'audio synchronisé et une application dédiée.
Pourquoi c’est important : Sora a fait passer la génération vidéo du statut de curiosité de recherche à celui de produit grand public, comprimant dans une boîte de texte un travail qui exigeait autrefois des caméras, des acteurs et des logiciels de montage. Il a aussi forcé des conversations concrètes sur les deepfakes, le droit à l'image et la provenance des contenus, avec lesquelles doit maintenant composer toute équipe qui lance des médias génératifs.
Veo
Google Veo, Veo 2, Veo 3
Modèles
La famille de modèles de génération vidéo de Google DeepMind, qui transforment des prompts textuels ou des images fixes en courts clips vidéo haute résolution. La lignée court du Veo original (2024) à Veo 3 (2025) en passant par Veo 2, cette dernière version étant la première à générer un audio natif — dialogues, effets sonores et musique — synchronisé avec l'image. Veo est proposé via l'outil de création cinématographique Flow de Google, l'application Gemini et des API pour développeurs.
Pourquoi c’est important : Veo a fixé la barre de qualité de la vidéo IA en 2025 : son réalisme physique a rendu les images générées nettement plus difficiles à distinguer de prises de vue réelles, et l'audio synchronisé de Veo 3 a transformé des clips muets en quelque chose d'approchant des scènes abouties. Pour les cinéastes, les publicitaires et les équipes de contenu, il a fait passer la vidéo IA du statut de démo gadget à celui d'outil de production utilisable, et c'est la référence à laquelle tout modèle vidéo rival est désormais comparé.
Whisper
OpenAI Whisper
Modèles
Un modèle de reconnaissance vocale à code source ouvert publié par OpenAI en 2022. Whisper convertit l'audio parlé en texte au moyen d'un transformer encodeur-décodeur entraîné sur 680 000 heures d'audio faiblement supervisé, et il prend en charge la transcription, la traduction vers l'anglais et l'identification de la langue dans des dizaines de langues avec un seul modèle. Comme les poids sont ouverts et que le modèle résiste bien aux accents et au bruit de fond, il est rapidement devenu la référence par défaut en reconnaissance automatique de la parole.
Pourquoi c’est important : Avant Whisper, une bonne reconnaissance vocale voulait surtout dire payer pour une API infonuagique ou accepter la justesse médiocre des solutions ouvertes. Whisper a rendu la transcription de qualité quasi humaine gratuite, hors ligne et accessible à quiconque possède un GPU ou même un processeur correct, ce qui a débloqué l'indexation de balados, les notes de réunion, l'analytique de centres d'appels, le sous-titrage et les outils d'accessibilité à grande échelle. Il a aussi réinitialisé les attentes de tout le domaine : chaque nouveau modèle de parole est désormais évalué par rapport à lui.
Falcon
TII Falcon, Falcon LLM
Modèles
Une famille de grands modèles de langage en poids ouverts développée par le Technology Innovation Institute (TII), la branche de recherche appliquée de l'Advanced Technology Research Council d'Abou Dabi. Falcon s'est imposée en 2023 lorsque ses modèles 40B et 180B ont dominé le Open LLM Leaderboard de Hugging Face, ce qui en a fait brièvement la famille de modèles sous licence permissive la plus performante disponible. La gamme s'est depuis élargie pour couvrir de petits formats embarqués, des variantes multimodales et des architectures hybrides.
Pourquoi c’est important : Falcon a été une preuve précoce qu'un modèle ouvert sérieux de classe frontière pouvait venir d'ailleurs que de l'axe États-Unis–Chine, et il est devenu un exemple phare d'IA souveraine menée par les poids ouverts. Sa licence permissive de type Apache a compté en pratique : à une époque où Llama comportait encore des restrictions d'usage, les entreprises pouvaient construire sur Falcon sans angoisse juridique. C'est aussi une étude de cas utile sur le fait que gagner les leaderboards et gagner l'adoption réelle sont deux choses différentes.
AlphaFold
AlphaFold 2, AlphaFold 3
Modèles
Un système de prédiction de la structure des protéines de Google DeepMind qui calcule la forme tridimensionnelle d'une protéine directement à partir de sa séquence d'acides aminés. AlphaFold 2 a égalé la justesse des méthodes expérimentales lors de l'évaluation CASP14 en 2020, et AlphaFold 3 a étendu l'approche aux complexes de protéines avec l'ADN, l'ARN et de petites molécules.
Pourquoi c’est important : La forme d'une protéine détermine sa fonction, donc connaître la structure est généralement la première étape en conception de médicaments, en ingénierie enzymatique et en biologie fondamentale. Déterminer une seule structure expérimentalement par cristallographie aux rayons X ou par cryomicroscopie électronique peut prendre des mois ou des années, alors qu'AlphaFold demande de quelques minutes à quelques heures de calcul. Une base de données publique de plus de 200 millions de structures prédites fait que bien des chercheurs peuvent sauter complètement l'exécution du modèle et simplement télécharger la réponse.
AlphaGo
AlphaZero, AlphaGo Zero
Modèles
Un système d'IA joueur de go bâti par Google DeepMind qui, en mars 2016, est devenu le premier programme informatique à battre un grand professionnel humain au go, défaisant le champion 9e dan Lee Sedol 4–1 dans un match de cinq parties à Séoul. AlphaGo combinait des réseaux de neurones profonds avec la recherche arborescente Monte-Carlo et l'apprentissage par renforcement par auto-affrontement, venant à bout d'un jeu qui avait résisté des décennies aux approches d'IA par force brute.
Pourquoi c’est important : Le match contre Lee Sedol est le moment où l'IA est entrée dans la culture générale : suivi par des centaines de millions de personnes, il a convaincu chercheurs, gouvernements et investisseurs que l'apprentissage automatique pouvait maîtriser des problèmes exigeant de l'intuition et de la planification à long terme, pas seulement de la reconnaissance de motifs. Les techniques qu'AlphaGo a validées — des réseaux de neurones qui guident la recherche, l'amélioration par auto-affrontement, l'estimation de la récompense future — se retrouvent aujourd'hui partout, des modèles de raisonnement au RLHF jusqu'à la découverte de médicaments. Il demeure la preuve canonique que des systèmes appris peuvent dépasser la performance d'experts humains dans un domaine qu'on croyait hors de portée pour des décennies.
LLM de diffusion
Diffusion LLM, Modèle de diffusion textuelle, dLLM
Modèles
Un grand modèle de langage qui génère du texte par débruitage itératif au lieu de prédire un token à la fois de gauche à droite. Il part d'une séquence entièrement masquée ou corrompue et raffine toutes les positions en parallèle sur un petit nombre d'étapes, empruntant l'idée centrale des modèles de diffusion d'images pour l'adapter au texte discret.
Pourquoi c’est important : La vitesse est l'argument principal : la latence évolue avec le nombre d'étapes de raffinement plutôt qu'avec la longueur de la réponse, donc une longue réponse ne coûte pas proportionnellement plus de temps. Les modèles de diffusion textuelle voient aussi le contexte dans les deux sens, ce qui les rend naturellement forts pour le remplissage, l'édition et la révision de textes existants plutôt que pour la seule continuation.
Compagnies
Safe Superintelligence (SSI) est une entreprise de recherche en IA fondée en 2024 par Ilya Sutskever, Daniel Gross et Daniel Levy. L'entreprise affiche un seul but et un seul produit prévu : une superintelligence qui soit sûre. Elle poursuit ce but avec une stratégie en ligne droite — aucun produit commercial, aucun revenu et aucune publication publique avant d'avoir terminé.
Pourquoi c’est important : SSI est le pari le plus pur à ce jour voulant que la sûreté en IA ne puisse pas être greffée après coup mais doive être conçue dès le départ. Fondée par l'ancien scientifique en chef d'OpenAI quelques semaines après son départ, et évaluée selon les rapports autour de 32 milliards de dollars en 2025 sans le moindre produit, elle teste si un petit laboratoire isolé peut encore atteindre la frontière à ses propres conditions. Ce qu'elle finira par livrer — ou refuser de livrer — façonnera la façon dont l'industrie parle du risque lié à la superintelligence.
Thinking Machines
Thinking Machines Lab, TML
Compagnies
Une entreprise de recherche et de produits en IA fondée en 2025 par Mira Murati, ancienne directrice technique d'OpenAI, et une équipe de chercheurs de premier plan. Son premier produit, Tinker, est une API d'ajustement fin qui permet aux développeurs de personnaliser des modèles de langage en poids ouverts sans exploiter leur propre infrastructure de GPU.
Pourquoi c’est important : Thinking Machines teste si le talent de recherche d'élite, plutôt que le calcul brut ou la distribution, est l'actif le plus rare en IA — sa ronde d'amorçage a évalué l'entreprise à environ 12 milliards de dollars avant qu'elle ait livré le moindre produit. Pour les praticiens, Tinker offre une voie mitoyenne entre utiliser un modèle tel quel et en entraîner un à partir de zéro : un vrai contrôle sur l'ajustement fin sans posséder la grappe d'entraînement.
Inflection AI
Inflection, Pi
Compagnies
Une entreprise d'IA fondée en 2022 par Mustafa Suleyman, Reid Hoffman et Karén Simonyan, surtout connue pour Pi, un assistant personnel conçu autour de l'intelligence émotionnelle plutôt que de l'exécution de tâches. Inflection a entraîné ses propres modèles de langage à l'échelle de la frontière, mais en 2024 Microsoft a embauché la majeure partie de l'équipe et pris une licence sur les modèles, après quoi l'entreprise résiduelle a pivoté vers l'IA d'entreprise.
Pourquoi c’est important : Inflection est l'étude de cas la plus claire de la brutalité économique du développement de modèles de pointe : même des fondateurs d'élite et plus d'un milliard de dollars de financement n'ont pas pu soutenir une entreprise d'agent conversationnel grand public face à OpenAI et Google. L'entente avec Microsoft a aussi établi le gabarit d'un nouveau genre d'absorption de talents par les géants technologiques — licence plus embauche au lieu d'une acquisition formelle — que régulateurs et concurrents surveillent de près depuis.
Baidu
Ernie, Wenxin Yiyan, Ernie Bot
Compagnies
Géant technologique chinois surtout connu pour son moteur de recherche et pour Ernie (Wenxin Yiyan), l'agent conversationnel et la famille de modèles de fondation qu'il a lancés en 2023 comme l'un des premiers grands rivaux chinois de ChatGPT. Baidu exploite aussi le service de robotaxis Apollo Go, conçoit ses propres puces d'IA Kunlun et vend toute la pile par l'entremise de sa division infonuagique.
Pourquoi c’est important : Baidu est l'acteur de l'IA le plus intégré verticalement en Chine : il fabrique des puces, un cadriciel d'apprentissage profond (PaddlePaddle), de grands modèles et les services grand public par-dessus. L'ouverture du code de la famille Ernie 4.5 en 2025 a donné aux équipes qui s'auto-hébergent et à celles sensibles aux coûts une autre option solide en poids ouverts, et son réseau de robotaxis est l'un des plus grands déploiements de l'IA en conditions réelles au monde.
Compagnies
Une entreprise chinoise d'IA fondée par Kai-Fu Lee en 2023, surtout connue pour sa série de grands modèles de langage Yi. 01.AI a combiné des publications en poids ouverts comme Yi-34B, qui a brièvement mené les classements de modèles ouverts, avec de plus gros modèles propriétaires vendus par API. En 2025, elle a pris ses distances avec l'entraînement de modèles de base de pointe pour se recentrer sur les applications d'entreprise et grand public, dont son assistant Wanzhi.
Pourquoi c’est important : 01.AI est l'une des études de cas les plus limpides sur l'économie de l'essor de l'IA : une jeune pousse peut trôner au sommet des classements de modèles ouverts, atteindre une valorisation rapportée d'un milliard de dollars dès sa première année, et conclure malgré tout qu'entraîner des modèles de pointe est une mauvaise affaire. Ses modèles Yi restent en circulation, et son virage de 2025 annonçait la pression de consolidation que ressent maintenant chaque laboratoire de modèles de taille moyenne.
Compagnies
Une entreprise allemande d'IA fondée à Heidelberg en 2019, surtout connue pour sa famille de grands modèles de langage Luminous et pour son accent sur la souveraineté des données au service des entreprises et des gouvernements européens. Après avoir d'abord concurrencé à la frontière du développement de modèles, elle a pivoté en 2024 vers PhariaAI, une pile logicielle complète pour bâtir et exploiter de l'IA sous le contrôle et les règles de conformité d'une organisation.
Pourquoi c’est important : Aleph Alpha est l'exemple européen phare de l'IA souveraine : l'idée qu'une capacité d'IA critique devrait tourner sur une infrastructure et selon des conditions qu'un pays ou une entreprise contrôle, plutôt que de dépendre d'une poignée de fournisseurs d'API américains. Sa trajectoire montre aussi la brutalité économique de l'entraînement de modèles de pointe, et comment les laboratoires de taille moyenne survivent en remontant la pile vers le logiciel d'entreprise, la conformité et la confiance.
Pika
Pika Labs
Compagnies
Une entreprise de génération vidéo par IA dont l'application web transforme des prompts textuels, des images fixes et des séquences téléversées en courts clips vidéo. Fondée en 2023 par les doctorantes de Stanford Demi Guo et Chenlin Meng, Pika est connue pour ses publications grand public rapides (de Pika 1.0 à 2.2), ses effets en un clic appelés Pikaffects et son système d'ingrédients qui oriente les scènes à l'aide d'images de référence.
Pourquoi c’est important : Pika est l'étude de cas la plus claire du volet grand public de la génération vidéo par IA : alors que certains rivaux courtisent cinéastes et studios, elle optimise pour les créateurs occasionnels qui font des mèmes et des clips sociaux. Ses contrôles par ingrédients montrent aussi comment le domaine s'attaque à la contrôlabilité — l'écart entre décrire une vidéo et obtenir vraiment celle qu'on avait en tête. Pour quiconque bâtit ou achète des outils vidéo, les paris de Pika sont un signal utile de ce que le grand public en fera réellement.
Compagnies
Udio est une entreprise de génération musicale par IA dont l'application web transforme des prompts textuels en chansons complètes, incluant voix, paroles et instrumentation. Fondée par d'anciens chercheurs de Google DeepMind et lancée publiquement en 2024, elle est devenue l'un des deux principaux services de texte-vers-chanson aux côtés de Suno, puis un cas d'espèce central dans la bataille juridique sur l'entraînement de l'IA à partir de musique protégée.
Pourquoi c’est important : Udio a fait passer le coût de production d'une maquette de qualité studio d'une séance d'enregistrement à quelques lignes de texte, ce qui change le flux de travail des musiciens qui esquissent des idées et des créateurs qui ont besoin de trames sonores sur mesure. Ses poursuites et ses ententes de licence avec les grandes maisons de disques ont aussi contribué à définir quelles données d'entraînement chaque entreprise d'IA générative peut légalement utiliser.
Compagnies
Une passerelle d'API unifiée qui donne aux développeurs accès à des centaines de grands modèles de langage de différents fournisseurs au moyen d'une seule clé d'API et d'une interface unique compatible avec OpenAI. Lancée en 2023 par Alex Atallah, elle gère le routage, les solutions de repli, la facturation et le suivi d'utilisation à travers des fournisseurs comme OpenAI, Anthropic, Google et les principaux hébergeurs de modèles en poids ouverts.
Pourquoi c’est important : Chaque modèle additionnel qu'une équipe veut essayer signifie normalement un nouveau compte, une nouvelle trousse de développement, une nouvelle relation de facturation et une nouvelle politique de limitation de débit à gérer. OpenRouter réduit toute cette surcharge à une seule intégration, si bien que changer de modèle devient une modification d'une ligne et que comparer prix, vitesse et qualité à l'échelle du marché devient praticable.
Fireworks AI
Fireworks, fireworks.ai
Compagnies
Fireworks AI est une plateforme d'inférence qui sert des modèles d'IA en poids ouverts derrière des API rapides à l'usage. Fondée en 2022 par des ingénieurs de l'équipe PyTorch de Meta, elle offre des points d'accès sans serveur facturés par token en parallèle de déploiements GPU dédiés pour les charges à gros volume, couvrant autant les grands modèles de langage que les modèles d'image, d'audio et d'embedding.
Pourquoi c’est important : Exécuter des modèles ouverts soi-même veut dire se procurer des GPU, ajuster une pile de service et absorber les pointes de trafic — une corvée opérationnelle dont la plupart des équipes produit ne veulent pas. Fireworks AI transforme ça en un appel d'API, si bien qu'une petite équipe peut bâtir sur des modèles comme Llama ou DeepSeek avec la latence d'un déploiement ajusté et une économie à l'usage. C'est l'un des principaux chemins par lesquels les modèles en poids ouverts atteignent réellement la production.
Compagnies
Une plateforme infonuagique pour exécuter des modèles d'apprentissage automatique par une API simple, sans infrastructure à gérer. Elle héberge des milliers de modèles publics en poids ouverts — image, vidéo, audio et langage — et permet aux développeurs de déployer leurs propres modèles empaquetés avec Cog, son outil de conteneurisation à code source ouvert. La facturation se fait à la seconde de calcul, donc les coûts suivent l'usage réel plutôt qu'une capacité réservée.
Pourquoi c’est important : Exécuter soi-même un modèle sérieux veut dire provisionner des GPU, résoudre des conflits de CUDA et de dépendances, et bâtir une couche de service — des jours de travail avant la première prédiction. Replicate comprime tout ça en quelques lignes de code, ce qui en fait un choix par défaut pour les prototypes, les projets parallèles et les fonctionnalités de production bâties sur des modèles ouverts. C'est aussi l'une des façons les plus faciles d'ajuster finement un modèle d'image ou de langage sur ses propres données.
Outils
Un assistant de codage par IA bâti par GitHub en partenariat avec OpenAI, lancé en 2021 et largement reconnu comme le premier programmeur en duo par IA à percer le grand public. Il s'exécute dans l'éditeur : il suggère des lignes et des fonctions entières à mesure que vous tapez, répond aux questions dans un panneau de conversation et — dans son mode agent plus récent — réalise des tâches de codage à plusieurs étapes à travers un dépôt. Il est offert pour VS Code, Visual Studio, les environnements JetBrains et Neovim, ainsi que sur github.com lui-même.
Pourquoi c’est important : Copilot a fait passer la programmation assistée par IA de la démonstration au réflexe quotidien : des millions de développeurs l'utilisent, et il a fixé le motif d'interaction — complétions en texte fantôme, conversation dans l'éditeur, exécution agentique de tâches — que presque tous les outils concurrents suivent maintenant. Pour les ingénieurs en exercice, il retranche du temps réel sur le code passe-partout, les tests unitaires et les API mal connues. Pour les équipes, il force aussi des décisions concrètes sur les normes de révision, l'exposition en matière de licences et le code qui peut quitter le réseau pour atteindre un fournisseur de modèles.
Devin
Cognition Devin, Cognition AI
Outils
Un ingénieur logiciel autonome en IA bâti par Cognition AI qui prend des tâches de haut niveau et les mène de bout en bout : planification, écriture de code, exécution des tests, débogage et ouverture de demandes de tirage dans son propre environnement isolé. Présenté en 2024 comme le premier produit annoncé comme un ingénieur logiciel en IA, Devin travaille de façon asynchrone — vous lui assignez un billet et vous revenez devant du travail terminé plutôt que de le regarder taper.
Pourquoi c’est important : Devin a déplacé la conversation sur les outils de codage par IA de l'autocomplétion vers la délégation : au lieu d'assister un humain frappe par frappe, il s'approprie des tâches entières pendant des heures. Pour les équipes ensevelies sous les migrations, les mises à niveau de dépendances et les arriérés de bogues, ça transforme l'assistant de codage d'un dactylo plus rapide en un coéquipier junior supplémentaire — avec de vraies conséquences sur la façon dont le travail est cadré, révisé et livré.
LlamaIndex
GPT Index
Outils
Un cadriciel de données à code source ouvert pour bâtir des applications de grands modèles de langage sur des données privées. LlamaIndex s'occupe de la plomberie entre vos documents et le modèle : chargement des données depuis des centaines de sources, découpage et indexation, récupération des passages pertinents au moment de la requête, et orchestration du prompt envoyé au modèle.
Pourquoi c’est important : La plupart des fonctionnalités de production en IA sont en réalité des problèmes de données : le modèle a besoin de la bonne tranche de vos documents dans son contexte avant de pouvoir répondre utilement. LlamaIndex est l'un des deux cadriciels dominants (avec LangChain) pour régler ça, et ses abstractions sont délibérément accordées aux charges de récupération et de question-réponse. Si vous bâtissez quoi que ce soit d'un agent de soutien à un outil de recherche documentaire, vous allez probablement soit l'utiliser, soit en réinventer des parties.
SGLang
SGLang Runtime, SRT
Outils
SGLang est un moteur de service à code source ouvert pour grands modèles de langage, bâti pour exécuter l'inférence rapidement et à faible coût à l'échelle de la production. Il a été publié en 2024 par des chercheurs enracinés à UC Berkeley et dans l'équipe LMSYS, et son idée signature est RadixAttention, une technique qui réutilise le calcul mis en cache entre des requêtes qui partagent des préfixes de prompt. C'est l'une des deux piles de service ouvertes dominantes, avec vLLM.
Pourquoi c’est important : L'inférence est là où va la majeure partie de l'argent quand on exploite des modèles de langage en production, et le moteur de service décide combien de GPU vous brûlez par requête. La réutilisation de préfixe et le décodage structuré rapide de SGLang peuvent couper fortement le coût et la latence sur les charges à prompt système partagé, à conversations multitours ou à sortie JSON. Il est aussi devenu un choix courant pour servir de très grands modèles ouverts, incluant des déploiements à mélange d'experts de l'échelle de DeepSeek, où un service naïf s'effondre.
A2A
Agent2Agent, Protocole Agent2Agent
Outils
A2A (Agent2Agent) est un protocole ouvert, lancé par Google en 2025, qui permet à des agents d'IA bâtis par différents fournisseurs et cadriciels de se découvrir, d'échanger des messages et de collaborer à des tâches. Il normalise la façon dont un agent annonce ses capacités, dont un autre agent lui confie du travail, et dont ce travail est suivi jusqu'à son achèvement, sans qu'aucune des deux parties expose son état interne. Il est conçu pour compléter MCP, qui relie les agents aux outils, plutôt que pour le remplacer.
Pourquoi c’est important : La plupart des agents vivent aujourd'hui en silos : un agent bâti sur une pile ne peut pas déléguer de travail à un agent bâti sur une autre sans code d'intégration sur mesure. A2A donne aux agents un langage commun pour la délégation, si bien qu'un agent client peut trouver un agent distant, lui envoyer une tâche et en recevoir les résultats peu importe qui l'a bâti ou quel modèle il exécute. Pour les entreprises qui assemblent de nombreux agents à travers des équipes et des fournisseurs, ça réduit le travail d'intégration deux à deux à une seule implémentation de protocole.
Reclassement
Reranking, Reclassement par encodeur croisé
Outils
Une seconde passe de notation dans une chaîne de récupération qui réordonne un ensemble initial de documents candidats avec un modèle de pertinence plus juste — et plus coûteux. Une première étape rapide comme la recherche vectorielle ou la recherche par mots-clés retourne les quelques dizaines de meilleurs candidats, et le reclasseur note chacun par rapport à la requête pour produire un meilleur ordre final.
Pourquoi c’est important : La récupération de première étape est optimisée pour la vitesse, pas la précision, donc le meilleur fragment atterrit souvent en position 12 plutôt qu'en position 1 — et ce qui atterrit en tête est ce que le modèle voit réellement dans son prompt. Le reclassement achète une grande amélioration de pertinence pour un coût de latence modeste, et c'est pourquoi c'est devenu une étape standard des systèmes de RAG en production.
Apprentissage en contexte
In-Context Learning, ICL
Fondamentaux
La capacité d'un grand modèle de langage à saisir une tâche à partir d'exemples ou d'instructions placés dans le prompt, sans aucune mise à jour des poids du modèle. Montrez-lui quelques paires entrée-sortie et il poursuit le motif sur de nouvelles entrées, se faisant de fait programmer en texte clair au moment de la requête. Popularisée par l'article de GPT-3 d'OpenAI en 2020, c'est la raison pour laquelle le prompt fonctionne comme interface.
Pourquoi c’est important : L'apprentissage en contexte a transformé un seul modèle figé en outil universel : au lieu d'entraîner un spécialiste pour chaque tâche, vous décrivez la tâche en texte et obtenez une réponse utilisable quelques secondes plus tard. C'est pourquoi l'ingénierie de prompts existe comme compétence et pourquoi des équipes sans chaîne d'entraînement peuvent livrer des fonctionnalités d'IA. Le hic, c'est que l'apprentissage est loué, pas possédé — il ne vit que dans la fenêtre de contexte, et vous repayez ces exemples à chaque appel.
Post-entraînement
Post-Training
Entraînement
L'ensemble des étapes d'entraînement appliquées à un modèle après le pré-entraînement, qui transforment un prédicteur brut de token suivant en assistant utilisable. Ça combine typiquement un ajustement fin supervisé sur des démonstrations, un ajustement par préférences à partir de rétroaction humaine ou d'IA, de l'apprentissage par renforcement sur des tâches vérifiables, et de l'entraînement à la sûreté. Le post-entraînement, c'est là où le comportement, le ton et les limites d'un modèle sont réellement fixés.
Pourquoi c’est important : Deux modèles pré-entraînés sur des données presque identiques peuvent sembler complètement différents en production à cause des choix de post-entraînement : l'un suit les instructions et refuse proprement les demandes nuisibles, l'autre divague ou refuse à l'excès. L'ère des modèles de raisonnement a fait du post-entraînement le principal facteur de différenciation entre laboratoires de pointe, et c'est aussi la seule couche où de plus petites équipes peuvent remodeler un modèle de façon significative sans payer le pré-entraînement.
PPO
Proximal Policy Optimization, Optimisation proximale de politique
Entraînement
PPO (Proximal Policy Optimization) est un algorithme d'apprentissage par renforcement qui met à jour une politique par petits pas contrôlés en écrêtant l'ampleur du déplacement de chaque mise à jour par rapport au comportement précédent de la politique. Présenté par OpenAI en 2017, il est devenu l'optimiseur par défaut du RLHF, l'étape d'entraînement par préférences derrière des modèles comme InstructGPT et ChatGPT.
Pourquoi c’est important : PPO est le mécanisme qui a permis d'entraîner les grands modèles de langage à suivre des instructions et à rester utiles au lieu de simplement prédire du texte. Si vous travaillez sur l'alignement, le post-entraînement ou les modèles de raisonnement, vous croiserez PPO ou l'un de ses descendants — et ses coûts et modes d'échec façonnent ce que les équipes d'entraînement peuvent réellement livrer.
GRPO
Group Relative Policy Optimization
Entraînement
Un algorithme d'apprentissage par renforcement pour l'ajustement fin de modèles de langage, présenté par DeepSeek en 2024 et popularisé par DeepSeek-R1. Au lieu d'entraîner un modèle de valeur distinct pour juger les sorties, il échantillonne un groupe de réponses candidates par prompt et note chacune par rapport à la récompense moyenne du groupe. Ça rend l'apprentissage par renforcement moins cher et plus simple à exécuter, et c'est devenu un choix standard pour le post-entraînement de modèles de raisonnement sur des tâches à récompenses vérifiables.
Pourquoi c’est important : GRPO a coupé le coût de l'ajustement fin par renforcement en éliminant le modèle critique, l'un des deux gros modèles que les chaînes classiques devaient entraîner et garder en mémoire, mettant l'entraînement de type raisonnement à la portée d'équipes sans infrastructure de laboratoire de pointe. C'est l'algorithme derrière DeepSeek-R1 et la plupart des modèles de raisonnement ouverts depuis, donc il apparaît maintenant dans presque toutes les piles de post-entraînement sérieuses. Si un modèle que vous utilisez a été entraîné à résoudre des problèmes de mathématiques, de code ou de logique, il y a de bonnes chances que GRPO ait été impliqué.
RLVR
Reinforcement Learning with Verifiable Rewards, Apprentissage par renforcement à récompenses vérifiables
Entraînement
Une méthode d'apprentissage par renforcement où le signal de récompense vient de vérificateurs automatiques et programmatiques — par exemple si une réponse mathématique est exactement correcte ou si le code généré passe les tests unitaires — plutôt que d'étiquettes de préférences humaines ou d'un modèle de récompense appris. Comme la justesse peut se vérifier mécaniquement, la boucle d'entraînement s'échelonne à des millions de problèmes sans annotateur humain dans la boucle. Le RLVR est l'approche d'entraînement derrière la récente vague de modèles de raisonnement.
Pourquoi c’est important : Le RLVR a transformé les mathématiques et le code en un signal d'entraînement presque illimité, et c'est ce qui a rendu possible l'ère des modèles de raisonnement : o1 d'OpenAI et DeepSeek-R1 doivent tous deux leurs capacités à cette recette. Pour les praticiens, ça veut dire qu'une équipe dotée d'un vérificateur — une suite de tests, un corrigé, un vérificateur de contraintes — peut améliorer un modèle dans ce domaine sans embaucher d'annotateurs ni entraîner de modèle de récompense. Ça a aussi déplacé le goulot d'étranglement du post-entraînement, de la collecte de rétroaction humaine vers l'écriture de bons vérificateurs.
LLM comme juge
LLM-as-Judge, Juge LLM, LLM-as-a-Judge
Entraînement
Une technique d'évaluation où un grand modèle de langage note les sorties d'un autre modèle (ou les siennes) au lieu de s'appuyer sur des évaluateurs humains. Le juge reçoit le prompt original, une ou deux réponses candidates et une grille de notation, et retourne un score, un verdict de préférence ou une critique. C'est devenu la méthode par défaut pour évaluer la génération ouverte, là où les métriques de chevauchement de chaînes comme BLEU et ROUGE s'effondrent.
Pourquoi c’est important : L'évaluation humaine est l'étalon-or pour juger du texte ouvert, mais elle est lente et coûteuse : une ronde d'évaluation sérieuse peut prendre des semaines et coûter des milliers de dollars. Un juge à modèle de langage retourne des milliers de jugements en quelques minutes pour quelques dollars, ce qui rend praticable l'évaluation de chaque changement de prompt, de chaque changement de modèle et de chaque version candidate. Il produit aussi les étiquettes de préférence que l'entraînement d'alignement moderne consomme à grande échelle.
Sécurité
Le domaine de recherche et d'ingénierie qui vise à faire en sorte que les systèmes d'IA se comportent de façon fiable, prévisible et conforme aux intentions humaines. Il couvre l'alignement, l'interprétabilité, la robustesse, l'évaluation et la gouvernance, englobant autant les préjudices à court terme comme l'hallucination et les biais que les préoccupations à plus long terme sur les systèmes très capables. Il se distingue de la sécurité de l'IA, qui protège les systèmes contre des attaquants externes plutôt que de corriger le comportement propre du système.
Pourquoi c’est important : Chaque modèle livré aux utilisateurs porte des modes d'échec — faits hallucinés, garde-fous contournables, décisions biaisées, agents qui posent des gestes non voulus — et ces échecs grandissent avec l'usage. Le travail de sûreté, c'est ce qui fait passer de « la démonstration a marché » à « le système tient le coup devant des millions d'utilisateurs et sous pression adverse », et les régulateurs le traitent de plus en plus comme une exigence légale plutôt qu'un agrément.
Utilisation de l'ordinateur
Computer Use, Agents d'utilisation d'ordinateur, Agents d'interface graphique, Computer-Using Agent (CUA)
Utiliser l’AI
Une capacité qui permet à un modèle d'IA d'utiliser un vrai bureau ou navigateur comme le ferait une personne : en regardant des captures d'écran et en émettant des actions de souris et de clavier. Au lieu d'appeler une API, le modèle perçoit l'écran, décide où cliquer ou quoi taper, et un exécuteur pose l'action, en boucle jusqu'à ce que la tâche soit terminée ou que l'agent abandonne. La fonction Computer Use d'Anthropic et Operator d'OpenAI en sont les implémentations les plus connues.
Pourquoi c’est important : La plupart des logiciels d'affaires ont été bâtis pour des humains, pas pour des machines, et une grande part d'entre eux n'ont aucune API utilisable. Les agents d'utilisation d'ordinateur peuvent en principe piloter tout ça — progiciels de gestion vieillissants, panneaux d'administration internes, sites web sans voie d'intégration — ce qui en fait la forme la plus générale d'automatisation par IA tentée jusqu'ici. Ce sont aussi les moins fiables aujourd'hui, donc comprendre leurs limites compte autant que comprendre leur promesse.
Recherche approfondie
Deep Research, Agents de recherche approfondie, Recherche agentique
Utiliser l’AI
Un mode offert par plusieurs assistants d'IA où le modèle planifie et mène de façon autonome une tâche de recherche web à plusieurs étapes, puis retourne un rapport structuré avec citations. Au lieu de répondre à partir d'une seule recherche rapide, il passe plusieurs minutes à lire des dizaines de sources, à suivre des pistes et à synthétiser ce qu'il trouve. OpenAI a présenté la fonction sous ce nom en février 2025, et des équivalents existent maintenant dans Gemini, Perplexity et Grok.
Pourquoi c’est important : Une exécution de recherche approfondie comprime des heures de revue documentaire manuelle — chercher, parcourir, recouper, prendre des notes — en une seule demande. Elle gagne sa vie sur les questions sans réponse unique faisant autorité : analyses de marché, comparaisons techniques, panoramas de politiques publiques et revues de littérature où l'ampleur et des citations traçables comptent plus que la vitesse.
Utiliser l’AI
Le vibe coding est une façon de bâtir du logiciel où vous décrivez ce que vous voulez en langage naturel, laissez un modèle d'IA écrire le code, et acceptez le résultat sans le réviser de près. Andrej Karpathy a forgé le terme en février 2025 pour un style de travail où l'on « s'abandonne complètement aux vibes » et où l'on « oublie que le code existe ». L'IA écrit, exécute et débogue le code; l'humain oriente par l'intention.
Pourquoi c’est important : Le vibe coding abaisse radicalement la barrière à la construction de logiciels : des gens sans formation en programmation peuvent livrer des prototypes fonctionnels, et les développeurs d'expérience avancent bien plus vite sur le code passe-partout et le code de liaison. Le hic, c'est que du code que personne n'a lu tend à cacher des bogues, des failles de sécurité et de la dette d'entretien, des coûts qui font surface plus tard et souvent au pire moment. Savoir quand ce compromis en vaut la peine est devenu une compétence pratique en soi.
Ingénierie de contexte
Context Engineering
Utiliser l’AI
La pratique consistant à concevoir, assembler et entretenir tout ce qu'un modèle voit dans sa fenêtre de contexte — le prompt système, les documents récupérés, les sorties d'outils, la mémoire et l'historique de conversation — pour qu'il puisse faire son travail de façon fiable. Le terme a émergé en 2025 comme successeur de l'ingénierie de prompts, reflétant un passage du réglage manuel d'une seule instruction à l'ingénierie de tout l'environnement informationnel autour du modèle.
Pourquoi c’est important : Un modèle ne peut raisonner que sur ce qu'il a devant lui, donc la qualité du contexte compte souvent plus que le modèle lui-même : un modèle de pointe avec un contexte gonflé et contradictoire fera moins bien qu'un plus petit modèle avec un contexte propre et bien sélectionné. Dans les systèmes de production, surtout les agents et les chaînes de RAG, la plupart des échecs remontent à des problèmes de contexte — information manquante, données périmées, contradictions, signal noyé — plutôt qu'à la capacité brute du modèle.
SLM
Small Language Model, Petit modèle de langage
Fondamentaux
Un modèle de langage conçu pour l'efficacité, allant typiquement d'environ 100 millions à 15 milliards de paramètres. Les petits modèles de langage sont assez petits pour s'exécuter sur du matériel grand public comme un portable, un téléphone ou un seul GPU plutôt que sur une grappe de centre de données, troquant une part d'étendue et de puissance de raisonnement contre un coût faible, une latence faible et la capacité de fonctionner hors ligne et sur l'appareil.
Pourquoi c’est important : Les petits modèles de langage, c'est ainsi que l'IA s'intègre dans des produits qui ne peuvent pas se permettre une facture d'API par requête, un aller-retour infonuagique ou l'envoi des données d'utilisateurs à un tiers. Pour des travaux étroits et bien définis — classification, extraction, courts résumés, appel de fonctions — un petit modèle ajusté finement égale souvent un modèle de pointe à une fraction du coût et de la latence. Ils s'exécutent aussi là où sont les données, ce qui compte pour la confidentialité, la conformité et l'usage hors ligne.
TPU
Tensor Processing Unit
Infrastructure
Une famille de puces accélératrices d'IA sur mesure (des ASIC) conçues par Google spécifiquement pour les charges d'apprentissage automatique. Les TPU troquent la souplesse généraliste d'un GPU contre une architecture en réseau systolique bâtie autour de grandes unités de multiplication matricielle, offrant un haut débit et une bonne efficacité énergétique sur les calculs tensoriels qui dominent l'apprentissage profond. Google les utilise à l'interne depuis 2015, les loue par Google Cloud, et entraîne dessus chaque modèle Gemini.
Pourquoi c’est important : Les TPU sont la preuve la plus solide que le calcul d'IA n'est pas un marché à fournisseur unique : c'est le seul silicium non NVIDIA à entraîner des modèles de pointe à grande échelle, et des entreprises comme Anthropic et Apple y ont misé des charges de travail majeures. Pour les praticiens, ils comptent comme solution de rechange sur Google Cloud qui peut battre les GPU sur le rapport prix-performance pour de gros entraînements et de l'inférence à gros volume, pourvu que la pile logicielle convienne.
Test de Turing
Turing Test, Jeu de l'imitation
Fondamentaux
Un test comportemental de l'intelligence des machines proposé par Alan Turing dans son article de 1950 « Computing Machinery and Intelligence ». Si un juge humain qui échange des messages textuels avec des interlocuteurs cachés ne peut pas distinguer de façon fiable la machine de l'humain, on dit que la machine manifeste un comportement intelligent. Turing l'offrait comme remplacement concret de la question plus floue de savoir si les machines peuvent penser.
Pourquoi c’est important : Le test de Turing a façonné plus de soixante-dix ans de débats sur ce qui compte comme intelligence machine, et il ancre encore la discussion publique chaque fois qu'on prétend qu'un agent conversationnel l'a réussi. Savoir ce que le test mesure réellement — une imitation convaincante sous pression du temps, pas de la compréhension — fait la différence entre lire ces manchettes de façon critique et les prendre au pied de la lettre.
ImageNet
ImageNet Challenge, ILSVRC
Entraînement
Un jeu de données d'images à grande échelle d'environ 14 millions d'images étiquetées à la main et organisées en plus de 20 000 catégories, publié pour la première fois en 2009 par une équipe dirigée par Fei-Fei Li. Son concours annuel associé, l'ImageNet Large Scale Visual Recognition Challenge (ILSVRC), est devenu le banc d'essai standard de la vision par ordinateur et a déclenché l'ère de l'apprentissage profond quand un réseau de neurones l'a remporté en 2012.
Pourquoi c’est important : ImageNet a prouvé que passer les données à l'échelle compte autant qu'inventer de meilleurs algorithmes, une leçon qui façonne encore la stratégie en IA aujourd'hui. Ses poids pré-entraînés sont devenus le point de départ par défaut du travail pratique en vision par ordinateur, et son sous-ensemble de référence à 1 000 classes reste la façon dont les nouvelles architectures de vision font leurs preuves.
EU AI Act
AI Act, Règlement européen sur l'IA
Sécurité
La loi complète de l'Union européenne encadrant l'intelligence artificielle, en vigueur depuis août 2024. Elle adopte une approche fondée sur le risque : plus un système d'IA pourrait causer de tort, plus les obligations sont strictes, allant d'interdictions pures et simples pour une poignée de pratiques à de légers devoirs de transparence pour les outils à faible risque.
Pourquoi c’est important : Si vous bâtissez, vendez ou déployez de l'IA dans l'Union européenne — ou si la sortie de votre modèle y est utilisée — la loi s'applique probablement à vous, peu importe où se trouve le siège de votre entreprise. Les violations des règles sur les pratiques interdites peuvent coûter jusqu'à 7 % du chiffre d'affaires annuel mondial, et la loi devient la base de conformité de fait de l'industrie, un peu comme le RGPD l'a fait pour la protection des données.
IA souveraine
Sovereign AI
Infrastructure
L'IA souveraine est une stratégie nationale de construction d'une capacité domestique en intelligence artificielle — l'infrastructure de calcul, les modèles et les données propres à un pays — pour que les charges d'IA critiques ne dépendent pas de fournisseurs étrangers. En pratique, ça veut dire des grappes de GPU appuyées par l'État, des modèles de fondation entraînés ou adaptés localement, et des règles exigeant que les données sensibles restent à l'intérieur des frontières nationales.
Pourquoi c’est important : L'IA souveraine détermine où s'exécutent les charges d'IA, quels modèles les gouvernements et les industries réglementées ont le droit d'utiliser, et qui capte la valeur économique de la technologie. Pour les praticiens, ça se manifeste par des exigences d'approvisionnement, des contraintes de résidence des données et un marché grandissant pour les nuages nationaux et les modèles hébergés localement.
Consommation énergétique de l'IA
AI Energy Consumption, Consommation électrique de l'IA
Infrastructure
L'électricité totale consommée par les systèmes d'IA au cours de leur cycle de vie, dominée par deux phases : l'entraînement ponctuel qui produit un modèle et l'inférence continue qui répond à chaque requête d'utilisateur. La charge comprend les accélérateurs eux-mêmes plus la surcharge de refroidissement, de réseautique et de distribution d'électricité autour d'eux. À mesure que les modèles et l'usage ont grandi, cette demande est devenue assez importante pour remodeler la planification des réseaux électriques de plusieurs pays.
Pourquoi c’est important : L'énergie est maintenant l'une des contraintes fortes sur le progrès de l'IA : une grappe d'entraînement qui tire des centaines de mégawatts ne peut exister que là où le réseau peut livrer autant de puissance, et la disponibilité électrique décide de plus en plus où la nouvelle capacité est bâtie. Pour les praticiens, l'énergie apparaît aussi directement dans les coûts de service et dans les prétentions de durabilité que chaque grand laboratoire d'IA doit maintenant défendre.
IA incarnée
Embodied AI, Intelligence incarnée, Modèles de fondation en robotique
Fondamentaux
Une approche de l'intelligence artificielle où des modèles commandent des machines physiques — des robots qui perçoivent, se déplacent et manipulent des objets dans le monde réel plutôt que de seulement traiter du texte et des images à l'écran. La prétention centrale, c'est qu'une véritable intelligence a besoin d'un corps : perception, raisonnement et contrôle moteur appris ensemble par l'interaction avec l'environnement. Le terme couvre tout, des bras d'entrepôt et des quadrupèdes jusqu'aux robots humanoïdes généralistes.
Pourquoi c’est important : L'IA incarnée, c'est là où les progrès récents des modèles de langage et de vision rencontrent l'économie physique : la fabrication, la logistique, la construction, l'agriculture et les soins reposent tous sur du travail physique. Un modèle qui peut remplir un lave-vaisselle ou garnir une tablette vaut bien plus qu'un modèle qui peut seulement en décrire les étapes, et une bonne part de l'industrie voit maintenant la robotique comme la prochaine frontière après les grands modèles de langage. Pour les praticiens, c'est aussi là que migrent les problèmes non résolus les plus difficiles de l'IA — rareté des données, sûreté, contrôle en temps réel.
ESC