NEOPOLIS AKADEMY
Fondamentaux des grands modèles de langage
Exploration des fondamentaux des grands modèles de langage : architecture Transformer, tokenisation, préparation de jeux de données et workflows d’entraînement. Approche technique axée sur la compréhension des composants et des étapes d’entraînement.
Découvrir cette formation sur Akademy ↗Les inscriptions et les modalités pratiques sont disponibles sur Neopolis Akademy.

Ce que vous allez découvrir
Architecture Transformer : mécanismes d’attention, couches de feed-forward et principes d’optimisation.
Tokenizers et représentation des séquences : méthodes de découpage, encodage et gestion des limites de contexte.
Jeux de données : collecte, nettoyage, échantillonnage et préparation pour entraînement supervisé ou par étapes.
Workflows d’entraînement : pipelines de fine-tuning, évaluation, gestion des hyperparamètres et surveillance d’entraînement.
PAS À PAS
Le programme de la formation
01Fondamentaux des grands modèles de langage
Fondamentaux des LLM et écosystème : concepts NLP/Transformers, tokenizers, pipelines, fine‑tuning, datasets, Hub, Gradio/Argilla, méthodes d'entraînement, évaluation et RL appliqué aux LLM. Couvre aussi debug et partage de modèles.
Introduit les bases du NLP et des Transformers, leur fonctionnement et comment ces architectures résolvent des tâches via des pipelines.
Explique tokenizers, gestion de séquences, traitement des données, boucles d'entraînement, fine‑tuning (Trainer API, SFTTrainer, LoRA) et compréhension des courbes d'apprentissage.
Présente l'utilisation du Hub pour modèles et datasets, la création/annotation de jeux de données, débogage des pipelines, Gradio pour démos et notions avancées de RL appliqué aux LLM.
Voir ce module sur Akademy ↗Source du programme : Neopolis Akademy. Fiche d’origine