AI Production Infrastructure and Model Serving Engineer

AI Production Infrastructure and Model Serving Engineer

NEOPOLIS AKADEMY

AI Production Infrastructure and Model Serving Engineer

Déployez charges de travail IA fiables : conteneurs, Kubernetes pour GPU, serverless, vLLM, autoscaling, pratiques de fiabilité et leviers pour gérer coûts et performance en production.

Découvrir cette formation sur Akademy ↗

Les inscriptions et les modalités pratiques sont disponibles sur Neopolis Akademy.

AI Production Infrastructure and Model Serving Engineer

Ce que vous allez découvrir

Parcours avancé centré sur l’infrastructure nécessaire aux services IA en production, de la conteneurisation à l’orchestration GPU.

Le module Kubernetes aborde la gestion des workloads GPU, les contraintes d’ordonnancement et l’intégration avec stockage et réseau.

L’enseignement sur le déploiement de modèles présente des approches de serving comme vLLM et les configurations serveurless adaptées aux inférences.

Enfin, le programme traite des pratiques de fiabilité, des stratégies de rollout et des techniques d’optimisation pour maîtriser coûts et disponibilité.

PAS À PAS

Le programme de la formation

01Infrastructure Foundations

Exploration des fondamentaux d’infrastructure pour mettre en production des modèles IA : choix CPU vs GPU, conteneurisation, traitements asynchrones et gestion des secrets. Approche orientée décisions d’architecture et impacts opérationnels.

Analyse des compromis entre CPU, GPU, solutions serverless et APIs managées pour orienter le déploiement selon coûts, latence et charge.

Principes de conteneurisation applicative pour IA : packaging, isolation, images et bonnes pratiques de déploiement.

Modèles de file d’attente, workers et inférence asynchrone pour découpler latence et traitement intensif.

Gestion des secrets, configurations et promotion d’environnements pour des pipelines reproductibles et sécurisés.

Voir ce module sur Akademy ↗
02Kubernetes and GPU Workloads

Approfondissement Kubernetes pour charges GPU : primitives Kubernetes adaptées aux services IA, ordonnancement GPU, opérateur NVIDIA et supervision des pannes GPU. Contenu pragmatique pour exploiter des clusters GPU en production.

Introduction aux primitives Kubernetes utiles aux services IA : Deployments, StatefulSets, Services et CRDs spécifiques.

Stratégies d’ordonnancement GPU : pools de nœuds, taints/tolerations et placement des workloads GPU.

Présentation de l’opérateur NVIDIA GPU pour déployer pilotes et composants GPU de façon déclarative.

Surveillance des GPU : métriques clés, modes de défaillance fréquents et méthodes d’investigation opérationnelle.

Voir ce module sur Akademy ↗
03Model Serving with vLLM

Présentation du serving avec vLLM : architectures de serving, compatibilité OpenAI-style, optimisation par batching et cache KV, et stratégies d’autoscaling et routage pour la production.

Comparaison des patterns d’architecture de serving : inference centralisée, microservices et edge serving selon besoins de latence et coût.

Principes de vLLM et mise en place d’endpoints compatibles OpenAI pour intégrer facilement des clients existants.

Techniques pour améliorer débit et latence : batching, cache clé-valeur et autres optimisations runtime.

Conception du stack de production : routage des requêtes, politiques d’autoscaling et considérations d’intégration.

Voir ce module sur Akademy ↗
04Reliability and Release

Focus sur fiabilité et mises en production : contrôles de santé et tests de charge, stratégies blue/green et canary, dégradations maîtrisées et revue de readiness avant mise en service.

Mise en place d’health checks et de tests de charge pour valider comportement sous contrainte et points de rupture.

Approches de release : blue/green, canary et méthodes de rollback pour limiter risques lors des déploiements.

Stratégies de fallback fournisseur et dégradation gracieuse pour maintenir service en cas d’incidents externes.

Checklist et revue de readiness production pour valider critères techniques et opérationnels avant ouverture au trafic.

Voir ce module sur Akademy ↗

Source du programme : Neopolis Akademy. Fiche d’origine