ElevenLabs
Pourquoi c’est important
En profondeur
ElevenLabs a été fondée en 2022 par Piotr Dabkowski et Mati Staniszewski, deux ingénieurs polonais qui se sont rencontrés lors d'une rencontre de passionnés d'apprentissage automatique et ont noué des liens autour d'une frustration partagée : le doublage dans les films et séries était horrible. Dabkowski, qui avait fait de la recherche chez Google, apportait une expertise technique approfondie en audio génératif; Staniszewski, ancien stratège chez Palantir, apportait le sens des affaires. Leur argumentaire était simple — des voix IA qui sonnent véritablement humaines — et les investisseurs ont adhéré rapidement. L'entreprise a levé 1 million de dollars en pré-amorçage, puis une Série B de 80 millions de dollars menée par Andreessen Horowitz et rejointe par Sequoia, Smash Capital et d'autres, atteignant une valorisation de 1,1 milliard de dollars début 2024. En janvier 2025, ils avaient levé une Série C de 180 millions de dollars à une valorisation estimée à 3,3 milliards de dollars, en faisant l'une des entreprises d'IA les plus rapides de l'histoire à atteindre ce seuil.
Le produit qui a changé la donne
Ce qui distinguait ElevenLabs des anciens outils de synthèse vocale était une qualité qui franchissait la vallée de l'étrangeté. Leur modèle Multilingual v2, publié en 2023, pouvait générer de la parole dans 29 langues avec une prosodie naturelle, de l'émotion et un rythme qu'il était véritablement difficile de distinguer d'un enregistrement humain. Le clonage vocal — où le système apprend à reproduire la voix d'une personne spécifique à partir d'un court échantillon audio — est devenu leur fonctionnalité signature. Les professionnels l'utilisaient pour cloner leurs propres voix pour la narration de livres audio, la création de contenu et le doublage. Le marché Voice Library permettait aux utilisateurs de partager et de monétiser des voix personnalisées, créant un écosystème autour de la technologie. Leur API d'IA conversationnelle en temps réel, lancée plus tard, a permis aux développeurs de construire des agents vocaux capables de tenir des conversations téléphoniques naturelles, ouvrant des applications en service à la clientèle, en santé et en éducation.
L'éthique des voix synthétiques
Un grand pouvoir a entraîné une controverse prévisible. La technologie de clonage vocal est inhéremment à double usage — le même outil qui permet à un auteur de narrer son propre livre audio sans passer des heures en studio permet aussi à un acteur malveillant d'usurper l'identité de quelqu'un à des fins de fraude ou de désinformation. ElevenLabs a fait face à des critiques précoces quand des voix clonées de célébrités sont apparues en ligne, et l'entreprise a répondu en resserrant ses exigences de vérification, en ajoutant un filigranage à l'audio généré via leur AI Speech Classifier, et en implémentant une liste de voix protégées. Ils ont également adopté la norme C2PA pour la provenance des contenus. Ces mesures ont aidé, mais la tension fondamentale demeure : plus la technologie s'améliore, plus il est difficile de contrôler les abus, et ElevenLabs s'est engagé à la rendre aussi performante que possible.
Modèle d'affaires et position concurrentielle
ElevenLabs exploite un modèle d'affaires API freemium. Les utilisateurs gratuits bénéficient d'un nombre limité de caractères par mois; les forfaits payants s'échelonnent des créateurs individuels aux contrats entreprise. La tarification est directe et conviviale pour les développeurs, ce qui les a aidés à bâtir une grande communauté rapidement. Ils ont également lancé des produits autonomes comme l'application ElevenLabs Reader (pour écouter des articles et documents) et un studio de doublage pour la localisation vidéo. Les concurrents incluent Amazon Polly, Google Cloud TTS, Microsoft Azure Speech et des nouveaux entrants comme PlayHT et Cartesia, mais ElevenLabs a maintenu une avance qualitative qui fait revenir les développeurs. L'entreprise s'est aussi étendue agressivement dans la génération de musique et d'effets sonores, signalant une ambition de dominer tout l'audio génératif, pas seulement la parole.
Où ils en sont maintenant
Au début de 2026, ElevenLabs est le choix par défaut pour les développeurs construisant des applications vocales. Leur technologie est à la base de milliers d'applications, de podcasts, de livres audio et d'outils d'entreprise. La véritable question est de savoir s'ils peuvent maintenir leur avance alors que les grands fournisseurs infonuagiques et les alternatives open source comblent l'écart qualitatif, et si l'environnement réglementaire autour des médias synthétiques créera des obstacles ou des remparts. Pour le moment, ils sont l'entreprise qui a prouvé que les voix IA pouvaient être suffisamment bonnes pour remplacer les enregistrements humains dans la plupart des contextes — une étape qui semblait encore lointaine avant qu'ils ne la concrétisent.