Prenez contact avec nous
 Durée 14 heures (2 jours)

Plan du cours

Introduction à la synthèse vocale et au clonage de la voix

  • Vue d’ensemble de la synthèse vocale texte-à-parole (TTS) et de la synthèse vocale neuronale
  • Clonage de la voix par rapport à la génération de la parole : cas d’usage et limites
  • Modèles clés : Tacotron, WaveNet, FastSpeech, VITS

Travail avec les plateformes commerciales

  • Utilisation d’ElevenLabs et de Resemble AI
  • Création, clonage et édition de voix
  • Accès API et flux de travail texte-à-parole

Création avec des outils open source

  • Installation et configuration de Coqui TTS
  • Entraînement de voix personnalisées et gestion des jeux de données
  • Génération de la parole avec un contrôle précis (hauteur de ton, vitesse, émotion)

Préparation des données et gestion des jeux de données vocaux

  • Collecte et nettoyage d’échantillons vocaux
  • Segmentation, étiquetage et alignement des transcriptions
  • Sourcing éthique et consentement vocal

Intégration d’applications

  • Intégration de la synthèse vocale dans les sites Web et les applications
  • Création de systèmes IVR et de bots interactifs
  • Génération de dialogues synthétiques pour la vidéo et les jeux

Évaluation de la qualité et du réalisme

  • MOS (Mean Opinion Score) et tests d’intelligibilité
  • Contrôle de l’expressivité et de la prosodie
  • Comparaison de la latence, de la fidélité et du réalisme

Considérations éthiques, juridiques et de gouvernance

  • Risques de deepfake et utilisation responsable
  • Consentement, attribution et implications liées au droit d’auteur
  • Règlements et politiques organisationnelles

Récapitulatif et prochaines étapes

Pré requis

  • Compréhension des fondamentaux de l’apprentissage automatique (Machine Learning)
  • Familiarité avec les formats de fichiers audio et les outils de montage
  • Compétences de base en programmation Python

Public cible

  • Développeurs et ingénieurs IA intéressés par la synthèse vocale
  • Créateurs de contenu et technologues des médias explorant la génération de voix
  • Équipes R&D développant des systèmes audio personnalisés ou dynamiques

Nombre de participants


Prix par participant

Cours à venir

Catégories Similaires