Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Durée 14 heures
Plan du cours
Introduction à la multimodalité de Gemini 3
- Capacités dans les domaines du texte, des images, de l'audio et de la vidéo
- Sélection des modèles et vue d'ensemble des points de terminaison
- Concepts clés du raisonnement multimodal
Travailler avec le texte et les entrées structurées
- Stratégies de prompting pour la génération de texte
- Métadonnées, fenêtres de contexte et embeddings
- Orchestration basée sur le texte des tâches multimodales
Compréhension des images et flux de travail visuels
- Analyse et interprétation des images avec Gemini 3
- Création d'outils de recherche visuelle et d'étiquetage
- Développement d'interactions image-versus-texte et texte-versus-image
Traitement des entrées audio
- Flux de travail de reconnaissance vocale et de transcription
- Détection et interprétation d'événements audio
- Intégration de l'audio avec les entrées textuelles et visuelles
Intelligence vidéo et analyse de scènes
- Raisonnement vidéo par image et continu
- Création d'outils de résumés et d'extraction de moments clés
- Automatisation basée sur la vidéo et flux de travail de contenu
Conception d'architectures d'applications multimodales
- Combinaison de plusieurs types d'entrées dans un pipeline unique
- Considérations sur la latence, le coût et les ressources de calcul
- Meilleures pratiques pour les systèmes multimodaux évolutifs
Prototypage d'applications multimodales
- Création pratique de prototypes multimodaux
- Itérations rapides grâce à l'ingénierie de prompts
- Test et raffinage des parcours d'expérience utilisateur
Déploiement de solutions multimodales
- Stratégies de déploiement et configuration de l'environnement
- Surveillance des performances en conditions réelles
- Considérations relatives à la sécurité et à la conformité
Résumé et prochaines étapes
Pré requis
- Compréhension des concepts modernes en IA
- Expérience avec Python ou JavaScript
- Familiarité avec les API REST
Public cible
- Concepteurs
- Créateurs de contenu
- Équipes de produits techniques
Nos clients témoignent (1)
Fluidez, ambiance et thème de la présentation
Lukasz Kowalczyk - Allegro Sp. z o.o.
Formation - Google Gemini AI for Data Analysis
Traduction automatique