Plan du cours
Infrastructure en tant que code pour EXO
- Aperçu des schémas de déploiement EXO : clusters mono-noeud, multi-noeuds et RDMA
- Automatiser l'installation des dépendances (Xcode, uv, Node.js, Rust) avec la gestion de configuration
- Utiliser les flakes Nix pour des builds EXO et des environnements de développement reproductibles
- Rédiger des playbooks Ansible ou des scripts shell pour le provisionnement non supervisé des clusters
Builds reproductibles et intégration CI
- Épingler les dépendances et construire le tableau de bord dans les pipelines CI
- Exécuter des tests de fumée EXO dans les runners GitHub Actions ou GitLab CI
- Créer des images de référence et des flux de rollback basés sur des instantanés pour les VMs macOS et Linux
- Versionner les fiches de modèles personnalisées aux côtés du code de l'application
Découverte de cluster et automatisation réseau
- Configurer mDNS et DNS statique pour une découverte fiable des nœuds libp2p
- Automatiser la création de profils réseau et la gestion du pont Thunderbolt sous macOS
- Utiliser des espaces de noms personnalisés (EXO_LIBP2P_NAMESPACE) pour séparer les clusters dev, staging et prod
- Règles de pare-feu et segmentation réseau pour les environnements multi-locataires
Gestion du cycle de vie du stockage et des modèles
- Concevoir les stratégies EXO_MODELS_DIRS et EXO_MODELS_READ_ONLY_DIRS
- Monter des partages NFS ou SAN en tant que dépôts de modèles en lecture seule pour un provisionnement rapide
- Nettoyage des caches obsolètes et politiques de rétention des poids versionnés
- Automatiser les pré-téléchargements de modèles et les vérifications de santé avant les mises à jour progressives
Surveillance et alertes
- Acheminer les journaux EXO vers un journalisation centralisée (ELK, Loki ou Splunk)
- Construire des tableaux de bord Grafana à partir de la sortie EXO_TRACING_ENABLED
- Alertes sur les changements d'appartenance au cluster, les événements OOM et les pics de latence d'inférence
- Corréler la télémétrie matérielle macmon avec les régressions des performances des modèles
Mise à jour, retour en arrière et reprise après sinistre
- Stocker les mises à jour des binaires EXO dans un nœud canari avant le déploiement généralisé
- Rollback au niveau du modèle : basculer entre les versions quantifiées sans re-téléchargement
- Sauvegarder et restaurer l'état du cluster, les espaces de noms personnalisés et les poids en cache
- Documenter les procédures de récupération pour les scénarios de reconstruction totale du cluster
- Appliquer TLS au niveau de la couche proxy inverse (nginx, traefik) pour le tableau de bord et l'API
- Mettre en œuvre une limitation du débit API et un whitelistage d'IP pour les points de terminaison EXO
- Isoler les clusters avec des VLANs et des politiques réseau zero-trust
- Auditer l'accès et maintenir un inventaire des modèles déployés et des versions
Pré requis
- Expérience avec les pratiques DevOps (CI/CD, IaC, orchestration de conteneurs)
- Connaissance de l'administration système et de la gestion des packages sous macOS ou Linux
- Compréhension des concepts de réseau, de DNS et de stockage
Audience cible
- Ingénieurs DevOps
- Architectes d'infrastructure
- SREs responsables des charges de travail IA sur site
Nos clients témoignent (2)
Craig était très impliqué dans la formation, toujours en s'assurant que nous prêtions attention, en adaptant les exemples à nos activités quotidiennes et en fournissant une réponse chaque fois qu'on lui posait une question, même si l'information n'était pas incluse dans la présentation.
Ecaterina Ioana Nicoale - BOOKING HOLDINGS ROMANIA SRL
Formation - DevOps Foundation®
Traduction automatique
Niveau élevé d’engagement et de connaissances du formateur
Jacek - Softsystem
Formation - DevOps Engineering Foundation (DOEF)®
Traduction automatique