Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Plan du cours
Introduction à EXO et au clustering d'IA local
- Aperçu du cadre EXO et de l'écosystème exo-explore
- Comparaison entre l'inférence cloud centralisée et l'inférence locale distribuée
- Architecture : découverte de dispositifs libp2p, backend MLX, tableau de bord et couches API
- Besoins matériels : Apple Silicon (M3 Ultra, M4 Pro/Max), Thunderbolt 5, stockage partagé
Installation d'EXO sur macOS
- Mise en place de Xcode, du Metal ToolChain et des prérequis macOS
- Installation de uv, Node.js et de la toolchain Rust nightly
- Installation de la fourche macmon spécifiée pour la surveillance sur Apple Silicon
- Clonage du dépôt et compilation du tableau de bord avec npm
- Lancement d'EXO à partir des sources et vérification du tableau de bord localhost:52415
Installation d'EXO sur Linux
- Installation des dépendances via apt ou Homebrew sous Linux
- Configuration de uv, Node.js 18+ et Rust nightly
- Compilation du tableau de bord et exécution d'EXO en mode uniquement CPU
- Structure des répertoires : chemins XDG Base Directory pour config, data, cache et logs
Découverte automatique des dispositifs et formation du cluster
- Compréhension de la découverte automatique basée sur libp2p à travers les réseaux locaux
- Configuration d'espaces de noms personnalisés avec EXO_LIBP2P_NAMESPACE pour l'isolation du cluster
- Vérification de l'appartenance des nœuds dans la vue cluster du tableau de bord
- Gestion des échecs de découverte et des problèmes de segmentation réseau
Activation de RDMA sur Thunderbolt 5
- Architecture RDMA et affirmation d'une réduction de latence de 99 %
- Activation de RDMA en mode récupération macOS avec rdma_ctl
- Besoins en câbles et contraintes de topologie des ports sur Mac Studio
- Correspondance des versions macOS sur tous les nœuds du cluster
- Résolution des problèmes de découverte RDMA et de configuration DHCP
Déploiement des modèles de pointe
- Utilisation du tableau de bord pour charger et partitionner les modèles DeepSeek v3.1, Qwen3-235B et la famille Llama
- Aperçu des placements d'instances via le point de terminaison /instance/previews de l'API
- Création d'instances de modèles avec un partitionnement par pipeline ou parallélisme tensoriel
- Configuration de cartes de modèle personnalisées depuis HuggingFace hub
Surveillance et dépannage
- Lecture des journaux EXO et compréhension du traçage distribué
- Interprétation de la santé du cluster dans la vue cluster du tableau de bord
- Diagnostic des échecs de nœuds workers et comportement de reconnexion
- Utilisation de EXO_TRACING_ENABLED pour l'analyse des goulots d'étranglement de performance
Maintenance et mises à jour du cluster
- Mise à jour des binaires EXO et procédures de recompilation du tableau de bord
- Migration des caches de modèles et gestion des modèles pré-téléchargés via NFS
- Retrait graduel des nœuds et équilibrage de la charge de travail
Pré requis
- Compréhension des fondamentaux du réseau (IP, subnetting, pare-feu)
- Expérience avec l'administration en ligne de commande sous macOS ou Linux
- Connaissance de la gestion des paquets Python (pip/uv) et des outils Node.js
Audience
- Administrateurs système
- Ingénieurs DevOps
- Architectes en infrastructure d'IA responsables du déploiement de LLM sur site
21 Heures