Aller au contenu principal
Home / Modèles / Audio

Audio & voix par IA

Chaque modèle audio qu’on sert — synthèse vocale, composition musicale, transcription, clonage de voix, isolation vocale, séparation de pistes. D’ElevenLabs et Suno à Cartesia et Deepgram. Prix réels, capacités réelles.

Données en direct de 18 fournisseurs audio — mis à jour quotidiennement
Affichage de 54 sur 54 modèles audio
🗣 Voix
Async Flash
Async
Synthèse vocale ultra-rapide en temps réel optimisée pour les applications à faible latence
🗣 VoixEssayer sur Zubnet →
🗣 Voix
AsyncFlow Multilingual
Async
Synthèse vocale multilingue prenant en charge 15 langues dont l'arabe, le japonais et le chinois
🗣 VoixEssayer sur Zubnet →
🗣 Voix
AsyncFlow v2.0
Async
Synthèse vocale haute qualité avec prosodie naturelle et expression émotionnelle dans 15 langues
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Aura
Deepgram
Modèle de synthèse vocale original de Deepgram — 12 voix anglaises à moitié prix d'Aura 2. Rapide et fiable.
textaudio
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Aura 2
Deepgram
Dernier modèle de synthèse vocale de Deepgram — plus de 90 voix naturelles dans 8 langues (EN, FR, DE, ES, IT, NL, JA), latence inférieure à 200 ms. Noms de voix inspirés de la mythologie grecque.
textaudio
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Bulbul v2
Sarvam AI
Modèle de synthèse vocale stable de Sarvam pour les langues indiennes et l'anglais. Retourne de l'audio WAV encodé en base64. Qualité constante en production.
textaudio
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Bulbul v3
Sarvam AI
Dernier modèle de synthèse vocale de Sarvam — plus de 30 voix dans les langues indiennes et l'anglais. Prosodie naturelle avec intonation culturelle. Actuellement en bêta.
textaudio
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Eleven v3
ElevenLabs
Modèle TTS le plus expressif avec balises audio, mode dialogue, émulation d'accent et plus de 70 langues. Idéal pour le contenu long.
textaudio
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Flash v2.5
ElevenLabs
TTS à latence ultra-faible pour l'IA conversationnelle en temps réel. ~75 ms de latence.
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Gemini 2.5 Flash TTS
Google
Synthèse vocale à faible latence de Google avec prosodie naturelle et style contrôlable. Prend en charge 24 langues.
textaudio
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Gemini 2.5 Pro TTS
Google
Synthèse vocale premium avec expressivité améliorée, tonalité plus riche et rythme précis. Idéal pour une sortie de haute qualité.
textaudio
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Gemini 3.1 Flash TTS
Google
Latest price-performant, low-latency controllable speech generation. 30 voices, 24 languages.
textaudio
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Grok TTS
xAI / Grok
xAI's expressive text-to-speech — 26 multilingual voices with inline speech tags for tone, pauses, whispers and laughter. 20+ languages with auto-detection.
🗣 VoixEssayer sur Zubnet →
📝 Transcription
Hakim Arabic v2
Hakim
Arabic-first speech-to-text with dialect-aware recognition and broad multilingual coverage.
$0.000292/track
audiotext
📝 TranscriptionEssayer sur Zubnet →
🗣 Voix
Hakim Fast v1
Hakim
Arabic-first text-to-speech, low-latency tier, with 50 voices spanning Arabic dialects and 20+ languages.
textaudio
🗣 VoixEssayer sur Zubnet →
🔊 Effets sonores
Long Video to SFX 1.6
Mirelo
Generate sound effects for longer videos (SFX 1.6), up to 60 seconds of audio from a video URL.
$0.1750/track
videoaudio
🔊 Effets sonoresEssayer sur Zubnet →
🎵 Musique
Lyria 3 Clip
Google
Google DeepMind's latest music generation — 30-second compositions from text prompts with SynthID watermarking.
$0.0700/track
textaudio
🎵 MusiqueEssayer sur Zubnet →
🎵 Musique
Lyria 3 Pro
Google
Full-song generation from Google DeepMind's Lyria 3 — complete compositions from text prompts with SynthID watermarking.
$0.1400/track
textaudio
🎵 MusiqueEssayer sur Zubnet →
🗣 Voix
Multilingual v2
ElevenLabs
Synthèse vocale la plus avancée avec conscience émotionnelle et expression riche dans 29 langues
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Murf Gen2
Murf
$0.000053/track
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Octave 1
Hume
Première génération de synthèse vocale empathique avec expression émotionnelle naturelle
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Octave 2
Hume
Dernier modèle de synthèse vocale empathique prenant en charge 11 langues avec conscience émotionnelle
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Rime Arcana
Rime
Rime's flagship voice model, 269 voices across 9 languages with rich emotional range.
textaudiotts
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Rime Coda
Rime
Stylized voices in 4 categories (Professional / Formal / Casual / Energetic). 184 voices, 8 languages.
textaudiotts
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Rime Mist
Rime
Original Mist model, 117 English voices, fast.
textaudiotts
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Rime Mist v2
Rime
Mist generation 2, 141 voices across 4 languages.
textaudiotts
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Rime Mist v3
Rime
Latest Mist generation, 83 voices, 4 languages. Improved expressiveness.
textaudiotts
🗣 VoixEssayer sur Zubnet →
📝 Transcription
Scribe v1
ElevenLabs
Reconnaissance vocale par lots avec horodatage au mot et détection de langue dans 99 langues.
$0.000170/track
audiotext
📝 TranscriptionEssayer sur Zubnet →
📝 Transcription
Scribe v2 Realtime
ElevenLabs
Reconnaissance vocale en temps réel à latence ultra-faible (<150 ms). 93,5 % de précision dans plus de 90 langues. Streaming WebSocket avec DAV.
$0.000170/track
audiotext
📝 TranscriptionEssayer sur Zubnet →
🗣 Voix
Simba English
Speechify
Synthèse vocale anglaise de haute qualité avec un rendu naturel
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Simba Multilingual
Speechify
Synthèse vocale naturelle prenant en charge plus de 60 langues avec des capacités multilingues complètes
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Simba Turbo
Speechify
Synthèse vocale anglaise ultra-rapide optimisée pour la vitesse avec latence minimale
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Sonic 3
Cartesia
Synthèse vocale ultra-réaliste la plus rapide et la plus expressive au monde avec plus de 60 émotions et 42 langues
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Sonic Turbo
Cartesia
Génération vocale à latence ultra-faible (40 ms) optimisée pour les applications en temps réel
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Speech 02 HD
MiniMax
Axé sur le rythme, la stabilité et la réplication vocale de haute qualité
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Speech 02 Turbo
MiniMax
Capacités multilingues améliorées à vitesse turbo
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Speech 2.6 HD
MiniMax
Dernière variante HD mettant l'accent sur la prosodie et la qualité du clonage vocal
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Speech 2.6 Turbo
MiniMax
Performance turbo avec prise en charge de 40 langues et faible latence
🗣 VoixEssayer sur Zubnet →
🗣 Voixnouveau
Speech 2.8 HD
MiniMax
Current HD voice model. Highest fidelity prosody and voice cloning.
🗣 VoixEssayer sur Zubnet →
🗣 Voixnouveau
Speech 2.8 Turbo
MiniMax
Current Turbo voice model. Low latency, broad language coverage.
🗣 VoixEssayer sur Zubnet →
📝 Transcription
Speechmatics Enhanced
Speechmatics
$0.000364/track
📝 TranscriptionEssayer sur Zubnet →
📝 Transcription
Speechmatics Melia
Speechmatics
$0.000117/track
📝 TranscriptionEssayer sur Zubnet →
📝 Transcription
Speechmatics Standard
Speechmatics
$0.000219/track
📝 TranscriptionEssayer sur Zubnet →
🎵 Musique
Stable Audio 2
StabilityAI
Générez musique et effets sonores jusqu'à 3 minutes à partir de prompts textuels. Produit des compositions structurées avec intros, développements et outros en stéréo 44,1 kHz.
$0.3500/track
🎵 MusiqueEssayer sur Zubnet →
🎵 Musique
Stable Audio 2.5
StabilityAI
Génération musicale et sonore de qualité entreprise. Compositions structurées avec intros, développements et outros en stéréo 44,1 kHz. Inférence en 8 étapes pour une génération rapide.
$0.3500/track
🎵 MusiqueEssayer sur Zubnet →
🎚 Séparation
Stem Separation
ElevenLabs
Séparez l'audio en pistes individuelles (voix, batterie, basse, etc.). Modes 2 ou 6 pistes.
$0.0029/track
audioaudio
🎚 SéparationEssayer sur Zubnet →
🎵 Musique
Suno V3.5
Suno
Meilleure organisation des chansons avec des structures couplet/refrain claires
$0.1050/track
🎵 MusiqueEssayer sur Zubnet →
🎵 Musique
Suno V4
Suno
Qualité vocale améliorée et traitement audio affiné pour la génération musicale
$0.1050/track
🎵 MusiqueEssayer sur Zubnet →
🎵 Musique
Suno V4.5
Suno
Excellente compréhension des prompts avec des vitesses de génération plus rapides, pistes jusqu'à 8 minutes
$0.1050/track
🎵 MusiqueEssayer sur Zubnet →
🎵 Musique
Suno V4.5 Plus
Suno
Modèle avancé avec variation tonale améliorée et excellente compréhension des prompts
$0.1050/track
🎵 MusiqueEssayer sur Zubnet →
🎵 Musique
Suno V5
Suno
Modèle de pointe avec qualité et capacités améliorées pour la génération musicale par IA
$0.1050/track
🎵 MusiqueEssayer sur Zubnet →
🗣 Voix
Turbo v2.5
ElevenLabs
Génération vocale à faible latence dans 32 langues, optimisée pour l'IA conversationnelle en temps réel
🗣 VoixEssayer sur Zubnet →
🔊 Effets sonores
Video to SFX 1.6
Mirelo
Generate and edit sound effects from video (SFX 1.6). Provide a video URL and optional text prompt; adds seamless extension, looping ambiences, and AI inpainting to erase/replace moments.
$0.0875/track
videotextaudio
🔊 Effets sonoresEssayer sur Zubnet →
🗣 Voix
Vidu Text to Speech
Vidu
Synthèse vocale naturelle avec vitesse, volume et hauteur ajustables.
🗣 VoixEssayer sur Zubnet →
ESC