Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Durée 14 heures (2 jours)
Plan du cours
Introduction à la synthèse vocale et au clonage de la voix
- Vue d’ensemble de la synthèse vocale texte-à-parole (TTS) et de la synthèse vocale neuronale
- Clonage de la voix par rapport à la génération de la parole : cas d’usage et limites
- Modèles clés : Tacotron, WaveNet, FastSpeech, VITS
Travail avec les plateformes commerciales
- Utilisation d’ElevenLabs et de Resemble AI
- Création, clonage et édition de voix
- Accès API et flux de travail texte-à-parole
Création avec des outils open source
- Installation et configuration de Coqui TTS
- Entraînement de voix personnalisées et gestion des jeux de données
- Génération de la parole avec un contrôle précis (hauteur de ton, vitesse, émotion)
Préparation des données et gestion des jeux de données vocaux
- Collecte et nettoyage d’échantillons vocaux
- Segmentation, étiquetage et alignement des transcriptions
- Sourcing éthique et consentement vocal
Intégration d’applications
- Intégration de la synthèse vocale dans les sites Web et les applications
- Création de systèmes IVR et de bots interactifs
- Génération de dialogues synthétiques pour la vidéo et les jeux
Évaluation de la qualité et du réalisme
- MOS (Mean Opinion Score) et tests d’intelligibilité
- Contrôle de l’expressivité et de la prosodie
- Comparaison de la latence, de la fidélité et du réalisme
Considérations éthiques, juridiques et de gouvernance
- Risques de deepfake et utilisation responsable
- Consentement, attribution et implications liées au droit d’auteur
- Règlements et politiques organisationnelles
Récapitulatif et prochaines étapes
Pré requis
- Compréhension des fondamentaux de l’apprentissage automatique (Machine Learning)
- Familiarité avec les formats de fichiers audio et les outils de montage
- Compétences de base en programmation Python
Public cible
- Développeurs et ingénieurs IA intéressés par la synthèse vocale
- Créateurs de contenu et technologues des médias explorant la génération de voix
- Équipes R&D développant des systèmes audio personnalisés ou dynamiques