LlamaIndex
Pourquoi c’est important
En profondeur
LlamaIndex a commencé comme GPT Index, un projet parallèle de Jerry Liu à la fin de 2022, né d'une observation simple : les grands modèles de langage ont une fenêtre de contexte limitée, donc faire entrer des données privées dans le modèle veut dire sélectionner les bons quelques milliers de tokens au moment de la requête plutôt que de tout lui donner. Le projet s'est rebaptisé LlamaIndex au début de 2023 (un clin d'œil aux modèles Llama de Meta, dont la popularité explosait alors), est devenu une entreprise, et forme aujourd'hui un écosystème mûr avec des versions Python et TypeScript, des centaines d'intégrations communautaires (LlamaHub) et un service infonuagique géré (LlamaCloud). La portée du cadriciel s'est élargie bien au-delà de ses racines d'indexation, mais le modèle mental reste le même : connectez vos données, indexez-les, et exposez-les à un modèle par des récupérateurs, des moteurs de requête et des agents.
Les abstractions centrales
Tout dans LlamaIndex se rattache à une poignée de concepts. Les connecteurs de données (lecteurs) chargent des documents depuis des sources comme des PDF, Notion, Slack, des bases SQL et GitHub; des centaines d'entre eux vivent sur LlamaHub comme paquets installables. Les analyseurs de nœuds découpent ensuite les documents en fragments, le SentenceSplitter étant celui par défaut — il tente de couper aux frontières de phrases et de paragraphes plutôt qu'à un compte brut de caractères, ce qui compte pour la qualité de récupération. Les index organisent ces fragments pour la recherche : VectorStoreIndex range les embeddings dans une base de données vectorielle pour la recherche sémantique, SummaryIndex parcourt simplement tout (utile pour les tâches de type « résume tout le document »), et il existe des variantes par mots-clés, par liste, par arbre et par graphe de connaissances. Enfin, un récupérateur va chercher les nœuds pertinents dans un index, et un moteur de requête ou de conversation enveloppe la boucle complète — récupérer, insérer dans le gabarit de prompt, appeler le modèle, retourner la réponse avec ses citations.
De GPT Index à un cadriciel de données
Le GPT Index original était une bibliothèque mince dont tout le travail consistait à surmonter les limites de contexte en structurant les documents en index consultables. À mesure que le RAG devenait le motif dominant de l'IA d'entreprise en 2023, la bibliothèque a absorbé toute la chaîne : ingestion, découpage, embedding, récupération, reclassement et synthèse. Cette concentration est ce qui la distingue philosophiquement de sa principale rivale. Là où LangChain vise à être un cadriciel généraliste pour enchaîner n'importe quelles opérations de modèle, LlamaIndex reste centré sur les données — ses abstractions présument que vous avez des documents et que vous voulez qu'un modèle raisonne dessus. En pratique, bien des équipes utilisent les deux, et les écosystèmes ont convergé : LangChain a acquis un solide outillage de récupération tandis que LlamaIndex développait des agents et de l'orchestration.
Ce n'est pas juste une bibliothèque de RAG
L'idée fausse répandue, c'est que LlamaIndex égale RAG égale recherche vectorielle. En réalité, une bonne part de sa surface moderne a peu à voir avec la récupération des k meilleurs résultats. Sa couche d'agents laisse un modèle planifier des tâches à plusieurs étapes et appeler des outils, et le système Workflows (une couche d'orchestration événementielle) modélise les programmes de modèle à plusieurs étapes comme des étapes discrètes avec des événements typés, ce qui est bien plus facile à déboguer et à réessayer qu'une seule chaîne géante. LlamaParse, le moteur d'analyse documentaire derrière LlamaCloud, convertit des PDF désordonnés avec tableaux et mises en page multicolonnes en markdown propre — et une qualité d'ingestion comme celle-là fait habituellement plus de différence que n'importe quel ajustement de récupération. Il y a aussi un solide soutien de la sortie structurée, donc vous pouvez bâtir des chaînes d'extraction qui transforment des documents non structurés en objets typés sans le moindre index vectoriel.
LlamaIndex contre LangChain
La comparaison revient dans chaque discussion d'architecture, et la réponse honnête, c'est que les cadriciels se recoupent beaucoup et que les deux fonctionnent. LlamaIndex tend à l'emporter quand la charge est lourde en documents : ses outils d'indexation, de récupération et d'évaluation sont plus profonds d'emblée, ses valeurs par défaut sont accordées à la question-réponse sur des corpus, et son abstraction de moteur de requête cache beaucoup de code passe-partout de RAG. LangChain tend à l'emporter quand la charge est lourde en orchestration avec de nombreux appels de modèle, de la logique de branchement et des outils non documentaires, et son écosystème LangGraph est fort pour les flux agentiques complexes. Les deux s'intègrent aux mêmes bases de données vectorielles, aux mêmes fournisseurs d'embeddings et aux mêmes outils d'observabilité, et les deux prennent en charge des normes comme MCP pour l'accès aux outils. Le vrai coût, c'est l'enfermement : quel que soit votre choix, vous achetez ses abstractions, donc les équipes qui prévoient dépasser le cadriciel gardent parfois sa surface mince et possèdent elles-mêmes la logique de récupération.
Considérations de production
Faire fonctionner une démonstration en un après-midi est facile; la rendre fiable, c'est là que le cadriciel gagne sa vie. La qualité d'ingestion domine les résultats, donc les équipes investissent dans l'analyse documentaire, l'extraction de métadonnées (dates, auteurs, types de documents attachés à chaque fragment) et des harnais d'évaluation qui mesurent le taux de réussite de récupération et la fidélité des réponses avant d'ajuster quoi que ce soit d'autre. LlamaCloud offre l'analyse, l'indexation et la récupération gérées pour les équipes qui ne veulent pas exploiter la chaîne elles-mêmes, au prix d'envoyer les documents à un service tiers — un non-recevoir pour certains régimes de conformité. Le cadriciel est agnostique quant au modèle, donc il fonctionne avec OpenAI, Anthropic ou des modèles locaux sur votre propre matériel, mais cette souplesse veut dire que vous assumez les compromis de latence et de coût de chaque appel de la chaîne.