Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Plan du cours
Souveraineté IA et déploiement local des LLM
- Les risques liés aux LLM cloud : rétention des données, entraînement sur les entrées, juridiction étrangère.
- Architecture d’Ollama : serveur de modèles, registre et API compatible avec celle d’OpenAI.
- Comparaison avec vLLM, llama.cpp et Text Generation Inference.
- Licences des modèles : conditions relatives à Llama, Mistral, Qwen et Gemma.
Installation et configuration matérielle
- Installation d’Ollama sous Linux avec prise en charge de CUDA et ROCm.
- Configuration uniquement sur CPU et optimisation AVX/AVX2.
- Déploiement via Docker et mappage des volumes persistants.
- Configuration multi-GPU et stratégies d’allocation de la VRAM.
Gestion des modèles
- Téléchargement des modèles depuis le registre Ollama : ollama pull llama3.
- Importation de modèles GGUF depuis HuggingFace et TheBloke.
- Niveaux de quantification : compromis entre Q4_K_M, Q5_K_M et Q8_0.
- Changement de modèle et limites de chargement simultané.
Modelfiles personnalisés
- Rédaction de la syntaxe des Modelfile : FROM, PARAMETER, SYSTEM, TEMPLATE.
- Ajustement du temperature, top_p et repeat_penalty.
- Ingénierie des invites système pour des comportements spécifiques par rôle.
- Création et publication de modèles personnalisés sur le registre local.
Intégration aux API
- Point de terminaison /v1/chat/completions compatible avec l’API d’OpenAI.
- Réponses en streaming et mode JSON.
- Intégration avec LangChain, LlamaIndex et des applications personnalisées.
- Authentification et limitation du débit via un proxy inverse.
Optimisation des performances
- Définir la taille de la fenêtre contextuelle et gérer le cache KV.
- Inférence par lots et traitement des requêtes parallèles.
- Affectation des threads CPU et prise en charge de la topologie NUMA.
- Surveillance de l’utilisation du GPU et de la pression mémoire.
Sécurité et conformité
- Isolation réseau pour les points de terminaison de service des modèles.
- Pipelines de filtrage des entrées et de modération des sorties.
- Journalisation d’audit des requêtes et des complétions.
- Vérification de l’origine du modèle et validation par hachage.
Pré requis
- Administration intermédiaire sous Linux et des conteneurs.
- Bonne compréhension globale du machine learning et des modèles de type transformer.
- Familiarité avec les API REST et le format JSON.
Audience cible
- Ingénieurs IA et développeurs souhaitant remplacer les API LLM cloud.
- Organisations confrontées à des contraintes de sensibilité des données limitant l’usage des modèles cloud.
- Équipes gouvernementales et de défense nécessitant des modèles linguaires en environnement air-gapped (non connecté).
14 Heures