Prenez contact avec nous

Plan du cours

Fondamentaux du déploiement de Tencent Hunyuan en production

  • Aperçu des scénarios de service des modèles Tencent Hunyuan.
  • Caractéristiques en production des modèles volumineux et de type MoE.
  • Goulets d'étranglement courants liés à la latence, au débit et aux coûts.
  • Définition des objectifs de niveau de service (SLO) pour les charges de travail d'inférence.

Architecture de déploiement et flux de service

  • Composants principaux d'une pile d'inférence en production.
  • Choix entre les modèles de déploiement conteneurisés, sur site ou dans le cloud.
  • Fondamentaux du chargement des modèles, du routage des requêtes et de l'allocation du GPU.
  • Conception pour la fiabilité et la simplicité opérationnelle.

Optimisation de la latence en pratique

  • Utilisation de moteurs d'inférence optimisés tels que TensorRT, lorsque cela est applicable.
  • Concepts du cache KV et réglage pratique du cache.
  • Réduction des délais de démarrage, de préchauffement (warmup) et de réponse.
  • Mesure du temps jusqu'au premier jeton (time to first token) et de la vitesse de génération des jetons.

Débit, groupement (batching) et efficacité du GPU

  • Stratégies de groupement continu et de groupement de requêtes.
  • Gestion de la concurrence et comportement des files d'attente.
  • Amélioration de l'utilisation du GPU sans nuire à l'expérience utilisateur.
  • Gestion des requêtes à contexte long et à charges de travail mixtes.

Quantification et contrôle des coûts

  • Pourquoi la quantification est cruciale pour le service en production.
  • Ajustements pratiques entre les options de précision courantes telles que FP16, INT8, etc.
  • Équilibre entre la qualité du modèle, la latence et le coût de l'infrastructure.
  • Élaboration d'une liste de vérification simple pour l'optimisation des coûts.

Opérations, surveillance et examen de la préparation opérationnelle

  • Déclencheurs de scaling automatique pour les services d'inférence.
  • Surveillance de la latence, du débit, de l'utilisation du cache et de la santé du GPU.
  • Fondamentaux de la journalisation (logging), des alertes et de la gestion des incidents.
  • Revue d'un déploiement de référence et élaboration d'un plan d'amélioration.

Pré requis

  • Compréhension de base des workflows de déploiement et d'inférence des grands modèles de langage (LLM).
  • Expérience avec les conteneurs, l'infrastructure cloud ou sur site, et les services basés sur API.
  • Maîtrise opérationnelle de Python ou des tâches d'ingénierie système.

Audience cible

  • Ingénieurs ML déployant des LLM en production.
  • Ingénieurs plateforme responsables des services d'inférence basés sur GPU.
  • Architectes solutions concevant des plateformes de déploiage d'IA évolutives.
 14 Heures

Nombre de participants


Prix par participant

Cours à venir

Catégories Similaires