Ce document, écrit par Arun Shankar (Applied AI, Google), présente un guide exhaustif sur l'apprentissage par renforcement (RL) appliqué aux grands modèles de langage. Le texte adopte une approche pédagogique unique présentant chaque concept mathématique dans deux formats parallèles : notation formelle et langage naturel, permettant une compréhension à différents niveaux de profondeur technique. L'auteur a conçu ce guide pour éliminer la barrière d'intimidation mathématique qui éloigne de nombreux ingénieurs du RL, démontrant que les concepts sont accessibles lorsqu'ils sont correctement expliqués.
Le guide commence par établir les fondements mathématiques nécessaires, incluant la probabilité, les logarithmes, la valeur attendue et les fonctions de perte, expliqués de manière intuitive avec des exemples numériques détaillés. Il aborde ensuite le problème central : pourquoi les modèles traditionnellement entraînés pour prédire des mots ne sont pas nécessairement utiles ou sûrs, introduisant le concept d'alignement avec les préférences humaines.
Le cœur du document explore la révolution RLHF (Reinforcement Learning from Human Feedback) qui a transformé des modèles comme ChatGPT. Il décrit en détail ses trois étapes : ajustement fin supervisé pour suivre les instructions, entraînement de modèles de récompense basés sur les comparaisons humaines, et optimisation utilisant des algorithmes comme PPO. Il inclut une analyse mathématique complète avec des exemples pas à pas illustrant comment les modèles apprennent à générer des réponses préférées par les humains.
Le texte examine les alternatives modernes comme DPO (Direct Preference Optimization), qui simplifie RLHF en éliminant le besoin de modèles de récompense explicites, réduisant les besoins en mémoire de 50%. Il analyse l'approche révolutionnaire de DeepSeek-R1 qui omet l'ajustement supervisé et applique le RL directement, découvrant spontanément des stratégies de raisonnement étape par étape sans exemples humains explicites.
Il couvre les concepts avancés tels que le scaling de calcul au moment du test (investir plus de calcul pendant l'inférence pour améliorer la précision), les modèles de récompense de processus (PRM) qui évaluent chaque étape du raisonnement plutôt que seulement les résultats finaux, et les algorithmes modernes au-delà de PPO et DPO, incluant GRPO, RLOO, KTO, IPO et ORPO, avec une analyse comparative de leurs avantages.
Le document explore les applications spécifiques par domaine : génération de code avec retour d'exécution, mathématiques avec vérificateurs formels, utilisation d'outils avec signaux de succès d'API, et amélioration du dialogue multi-tours. Il examine les techniques de génération guidée par vérificateur, la recherche arborescente avec Monte Carlo Tree Search, et les stratégies de décodage comme le rejection sampling et la self-consistency.
Destiné aux professionnels de l'IA, chercheurs, ingénieurs et étudiants, le matériel est accessible aux lecteurs lycéens intéressés par l'IA jusqu'aux experts construisant des systèmes de production. Chaque concept est présenté avec des intuitions, des analogies du monde réel, des exemples numériques détaillés et des avertissements sur les pièges courants, permettant trois niveaux de lecture selon les objectifs du lecteur.
18/03/2026
Rapport d'Accenture analysant pourquoi le cloud doit évoluer pour soutenir l'innovation en IA. À partir de données issues de 216 entreprises, il ...
05/03/2026
Étude d'Anthropic proposant une nouvelle façon de mesurer l'impact réel de l'IA sur le marché du travail. Combine capacités théoriques et ...
27/01/2026
Essai de Dario Amodei analysant les principaux risques des systèmes d'IA de plus en plus puissants : des comportements autonomes imprévisibles aux ...
23/01/2026
Rapport de Harvard Business Review Analytic Services basé sur 623 répondants analysant l'état actuel de l'IA agentique dans les organisations : ...