Prenez contact avec nous

Plan du cours

Souveraineté IA et déploiement local des LLM

  • Les risques liés aux LLM cloud : rétention des données, entraînement sur les entrées, juridiction étrangère.
  • Architecture d’Ollama : serveur de modèles, registre et API compatible avec celle d’OpenAI.
  • Comparaison avec vLLM, llama.cpp et Text Generation Inference.
  • Licences des modèles : conditions relatives à Llama, Mistral, Qwen et Gemma.

Installation et configuration matérielle

  • Installation d’Ollama sous Linux avec prise en charge de CUDA et ROCm.
  • Configuration uniquement sur CPU et optimisation AVX/AVX2.
  • Déploiement via Docker et mappage des volumes persistants.
  • Configuration multi-GPU et stratégies d’allocation de la VRAM.

Gestion des modèles

  • Téléchargement des modèles depuis le registre Ollama : ollama pull llama3.
  • Importation de modèles GGUF depuis HuggingFace et TheBloke.
  • Niveaux de quantification : compromis entre Q4_K_M, Q5_K_M et Q8_0.
  • Changement de modèle et limites de chargement simultané.

Modelfiles personnalisés

  • Rédaction de la syntaxe des Modelfile : FROM, PARAMETER, SYSTEM, TEMPLATE.
  • Ajustement du temperature, top_p et repeat_penalty.
  • Ingénierie des invites système pour des comportements spécifiques par rôle.
  • Création et publication de modèles personnalisés sur le registre local.

Intégration aux API

  • Point de terminaison /v1/chat/completions compatible avec l’API d’OpenAI.
  • Réponses en streaming et mode JSON.
  • Intégration avec LangChain, LlamaIndex et des applications personnalisées.
  • Authentification et limitation du débit via un proxy inverse.

Optimisation des performances

  • Définir la taille de la fenêtre contextuelle et gérer le cache KV.
  • Inférence par lots et traitement des requêtes parallèles.
  • Affectation des threads CPU et prise en charge de la topologie NUMA.
  • Surveillance de l’utilisation du GPU et de la pression mémoire.

Sécurité et conformité

  • Isolation réseau pour les points de terminaison de service des modèles.
  • Pipelines de filtrage des entrées et de modération des sorties.
  • Journalisation d’audit des requêtes et des complétions.
  • Vérification de l’origine du modèle et validation par hachage.

Pré requis

  • Administration intermédiaire sous Linux et des conteneurs.
  • Bonne compréhension globale du machine learning et des modèles de type transformer.
  • Familiarité avec les API REST et le format JSON.

Audience cible

  • Ingénieurs IA et développeurs souhaitant remplacer les API LLM cloud.
  • Organisations confrontées à des contraintes de sensibilité des données limitant l’usage des modèles cloud.
  • Équipes gouvernementales et de défense nécessitant des modèles linguaires en environnement air-gapped (non connecté).
 14 Heures

Nombre de participants


Prix par participant

Cours à venir

Catégories Similaires