Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Durée 21 heures
Plan du cours
Introduction à l'IA multimodale et à Ollama
- Aperçu de l'apprentissage multimodal
- Défis clés de l'intégration vision-langage
- Capacités et architecture d'Ollama
Configuration de l'environnement Ollama
- Installation et configuration d'Ollama
- Gestion du déploiement de modèles locaux
- Intégration d'Ollama avec Python et Jupyter
Travail avec des entrées multimodales
- Intégration du texte et des images
- Incorporation de l'audio et des données structurées
- Conception de pipelines de prétraitement
Applications de compréhension documentaire
- Extraction d'informations structurées à partir de PDF et d'images
- Combinaison de la reconnaissance optique de caractères (ROC) avec les modèles de langage
- Construction de flux de travail d'analyse documentaire intelligente
Questions-réponses visuelles (VQA)
- Mise en place de jeux de données et de référence pour le VQA
- Entraînement et évaluation de modèles multimodaux
- Construction d'applications VQA interactives
Conception d'agents multimodaux
- Principes de conception d'agents avec raisonnement multimodal
- Combinaison de la perception, du langage et de l'action
- Déploiement d'agents pour des cas d'usage réels
Intégration et optimisation avancées
- Ajustement fin de modèles multimodaux avec Ollama
- Optimisation des performances d'inférence
- Considérations relatives à l'évolutivité et au déploiement
Résumé et prochaines étapes
Pré requis
- Bonne compréhension des concepts d'apprentissage automatique
- Expérience avec des cadres d'apprentissage profond tels que PyTorch ou TensorFlow
- Familiarité avec le traitement du langage naturel et la vision par ordinateur
Public visé
- Ingénieurs en apprentissage automatique
- Chercheurs en IA
- Développeurs de produits intégrant des flux de travail impliquant la vision et le texte