Audio & voix par IA
Chaque modèle audio qu’on sert — synthèse vocale, composition musicale, transcription, clonage de voix, isolation vocale, séparation de pistes. D’ElevenLabs et Suno à Cartesia et Deepgram. Prix réels, capacités réelles.
Données en direct de 18 fournisseurs audio — mis à jour quotidiennement
🗣 Voix
Synthèse vocale ultra-rapide en temps réel optimisée pour les applications à faible latence
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Synthèse vocale multilingue prenant en charge 15 langues dont l'arabe, le japonais et le chinois
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Synthèse vocale haute qualité avec prosodie naturelle et expression émotionnelle dans 15 langues
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Modèle de synthèse vocale original de Deepgram — 12 voix anglaises à moitié prix d'Aura 2. Rapide et fiable.
textaudio
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Dernier modèle de synthèse vocale de Deepgram — plus de 90 voix naturelles dans 8 langues (EN, FR, DE, ES, IT, NL, JA), latence inférieure à 200 ms. Noms de voix inspirés de la mythologie grecque.
textaudio
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Modèle de synthèse vocale stable de Sarvam pour les langues indiennes et l'anglais. Retourne de l'audio WAV encodé en base64. Qualité constante en production.
textaudio
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Dernier modèle de synthèse vocale de Sarvam — plus de 30 voix dans les langues indiennes et l'anglais. Prosodie naturelle avec intonation culturelle. Actuellement en bêta.
textaudio
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Modèle TTS le plus expressif avec balises audio, mode dialogue, émulation d'accent et plus de 70 langues. Idéal pour le contenu long.
textaudio
🗣 VoixEssayer sur Zubnet →
🗣 Voix
TTS à latence ultra-faible pour l'IA conversationnelle en temps réel. ~75 ms de latence.
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Synthèse vocale à faible latence de Google avec prosodie naturelle et style contrôlable. Prend en charge 24 langues.
textaudio
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Synthèse vocale premium avec expressivité améliorée, tonalité plus riche et rythme précis. Idéal pour une sortie de haute qualité.
textaudio
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Latest price-performant, low-latency controllable speech generation. 30 voices, 24 languages.
textaudio
🗣 VoixEssayer sur Zubnet →
🗣 Voix
xAI's expressive text-to-speech — 26 multilingual voices with inline speech tags for tone, pauses, whispers and laughter. 20+ languages with auto-detection.
🗣 VoixEssayer sur Zubnet →
📝 Transcription
Arabic-first speech-to-text with dialect-aware recognition and broad multilingual coverage.
$0.000292/track
audiotext
📝 TranscriptionEssayer sur Zubnet →
🗣 Voix
Arabic-first text-to-speech, low-latency tier, with 50 voices spanning Arabic dialects and 20+ languages.
textaudio
🗣 VoixEssayer sur Zubnet →
🔊 Effets sonores
Generate sound effects for longer videos (SFX 1.6), up to 60 seconds of audio from a video URL.
$0.1750/track
videoaudio
🔊 Effets sonoresEssayer sur Zubnet →
🎵 Musique
Google DeepMind's latest music generation — 30-second compositions from text prompts with SynthID watermarking.
$0.0700/track
textaudio
🎵 MusiqueEssayer sur Zubnet →
🎵 Musique
Full-song generation from Google DeepMind's Lyria 3 — complete compositions from text prompts with SynthID watermarking.
$0.1400/track
textaudio
🎵 MusiqueEssayer sur Zubnet →
🗣 Voix
Synthèse vocale la plus avancée avec conscience émotionnelle et expression riche dans 29 langues
🗣 VoixEssayer sur Zubnet →
🗣 Voix
$0.000053/track
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Première génération de synthèse vocale empathique avec expression émotionnelle naturelle
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Dernier modèle de synthèse vocale empathique prenant en charge 11 langues avec conscience émotionnelle
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Rime's flagship voice model, 269 voices across 9 languages with rich emotional range.
textaudiotts
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Stylized voices in 4 categories (Professional / Formal / Casual / Energetic). 184 voices, 8 languages.
textaudiotts
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Original Mist model, 117 English voices, fast.
textaudiotts
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Mist generation 2, 141 voices across 4 languages.
textaudiotts
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Latest Mist generation, 83 voices, 4 languages. Improved expressiveness.
textaudiotts
🗣 VoixEssayer sur Zubnet →
📝 Transcription
Reconnaissance vocale par lots avec horodatage au mot et détection de langue dans 99 langues.
$0.000170/track
audiotext
📝 TranscriptionEssayer sur Zubnet →
📝 Transcription
Reconnaissance vocale en temps réel à latence ultra-faible (<150 ms). 93,5 % de précision dans plus de 90 langues. Streaming WebSocket avec DAV.
$0.000170/track
audiotext
📝 TranscriptionEssayer sur Zubnet →
🗣 Voix
Synthèse vocale anglaise de haute qualité avec un rendu naturel
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Synthèse vocale naturelle prenant en charge plus de 60 langues avec des capacités multilingues complètes
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Synthèse vocale anglaise ultra-rapide optimisée pour la vitesse avec latence minimale
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Synthèse vocale ultra-réaliste la plus rapide et la plus expressive au monde avec plus de 60 émotions et 42 langues
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Génération vocale à latence ultra-faible (40 ms) optimisée pour les applications en temps réel
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Axé sur le rythme, la stabilité et la réplication vocale de haute qualité
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Capacités multilingues améliorées à vitesse turbo
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Dernière variante HD mettant l'accent sur la prosodie et la qualité du clonage vocal
🗣 VoixEssayer sur Zubnet →
🗣 Voix
Performance turbo avec prise en charge de 40 langues et faible latence
🗣 VoixEssayer sur Zubnet →
🗣 Voixnouveau
Current HD voice model. Highest fidelity prosody and voice cloning.
🗣 VoixEssayer sur Zubnet →
🗣 Voixnouveau
Current Turbo voice model. Low latency, broad language coverage.
🗣 VoixEssayer sur Zubnet →
📝 Transcription
$0.000364/track
📝 TranscriptionEssayer sur Zubnet →
📝 Transcription
$0.000117/track
📝 TranscriptionEssayer sur Zubnet →
📝 Transcription
$0.000219/track
📝 TranscriptionEssayer sur Zubnet →
🎵 Musique
Générez musique et effets sonores jusqu'à 3 minutes à partir de prompts textuels. Produit des compositions structurées avec intros, développements et outros en stéréo 44,1 kHz.
$0.3500/track
🎵 MusiqueEssayer sur Zubnet →
🎵 Musique
Génération musicale et sonore de qualité entreprise. Compositions structurées avec intros, développements et outros en stéréo 44,1 kHz. Inférence en 8 étapes pour une génération rapide.
$0.3500/track
🎵 MusiqueEssayer sur Zubnet →
🎚 Séparation
Séparez l'audio en pistes individuelles (voix, batterie, basse, etc.). Modes 2 ou 6 pistes.
$0.0029/track
audioaudio
🎚 SéparationEssayer sur Zubnet →
🎵 Musique
Meilleure organisation des chansons avec des structures couplet/refrain claires
$0.1050/track
🎵 MusiqueEssayer sur Zubnet →
🎵 Musique
Qualité vocale améliorée et traitement audio affiné pour la génération musicale
$0.1050/track
🎵 MusiqueEssayer sur Zubnet →
🎵 Musique
Excellente compréhension des prompts avec des vitesses de génération plus rapides, pistes jusqu'à 8 minutes
$0.1050/track
🎵 MusiqueEssayer sur Zubnet →
🎵 Musique
Modèle avancé avec variation tonale améliorée et excellente compréhension des prompts
$0.1050/track
🎵 MusiqueEssayer sur Zubnet →
🎵 Musique
Modèle de pointe avec qualité et capacités améliorées pour la génération musicale par IA
$0.1050/track
🎵 MusiqueEssayer sur Zubnet →
🗣 Voix
Génération vocale à faible latence dans 32 langues, optimisée pour l'IA conversationnelle en temps réel
🗣 VoixEssayer sur Zubnet →
🔊 Effets sonores
Generate and edit sound effects from video (SFX 1.6). Provide a video URL and optional text prompt; adds seamless extension, looping ambiences, and AI inpainting to erase/replace moments.
$0.0875/track
videotextaudio
🔊 Effets sonoresEssayer sur Zubnet →
🗣 Voix
Synthèse vocale naturelle avec vitesse, volume et hauteur ajustables.
🗣 VoixEssayer sur Zubnet →