Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Durée 14 heures (2 jours)
Plan du cours
Aperçu des technologies de reconnaissance vocale
- Histoire et évolution de la reconnaissance vocale
- Modèles acoustiques, modèles linguistiques et décodage
- Architectures modernes : RNN, transformers et Whisper
Prétraitement audio et bases de la transcription
- Gestion des formats audio et des taux d'échantillonnage
- Nettoyage, rognage et segmentation audio
- Génération de texte à partir de l'audio : temps réel vs lot
Manipulation pratique avec Whisper et autres API
- Installation et utilisation d'OpenAI Whisper
- Appel d'API cloud (Google, Azure) pour la transcription
- Comparaison des performances, de la latence et du coût
Langue, accents et adaptation au domaine
- Travail avec plusieurs langues et accents
- Vocabulaires personnalisés et tolérance au bruit
- Gestion du langage juridique, médical ou technique
Formatage de la sortie et intégration
- Ajout de codes horaires, de ponctuation et d'étiquettes de locuteur
- Export vers des formats texte, SRT ou JSON
- Intégration des transcriptions dans des applications ou des bases de données
Laboratoires de mise en œuvre de cas d'usage
- Transcription de réunions, d'entrevues ou de podcasts
- Systèmes de commandes vocales
- Sous-titres en temps réel pour les flux vidéo/audio
Évaluation, limites et éthique
- Métriques de précision et banc d'essai des modèles
- Biais et équité dans les modèles vocaux
- Considérations relatives à la confidentialité et à la conformité
Résumé et prochaines étapes
Pré requis
- Compréhension des concepts généraux de l'IA et de l'apprentissage automatique
- Familiarité avec les formats et les outils de fichiers audio ou multimédias
Public cible
- Scientifiques des données et ingénieurs en IA travaillant avec des données vocales
- Développeurs logiciels concevant des applications basées sur la transcription
- Organisations explorant la reconnaissance vocale pour l'automatisation