Reinforcement Learning for Large Language Models

Arun Shankar
15/10/2025
Guide complet sur l'apprentissage par renforcement pour les modèles de langage, des concepts mathématiques fondamentaux aux techniques avancées. Explique RLHF, DPO, modèles de récompense, stratégies de raisonnement et applications pratiques avec une approche accessible et rigoureuse.
Reinforcement Learning for Large Language Models

Ce document, écrit par Arun Shankar (Applied AI, Google), présente un guide exhaustif sur l'apprentissage par renforcement (RL) appliqué aux grands modèles de langage. Le texte adopte une approche pédagogique unique présentant chaque concept mathématique dans deux formats parallèles : notation formelle et langage naturel, permettant une compréhension à différents niveaux de profondeur technique. L'auteur a conçu ce guide pour éliminer la barrière d'intimidation mathématique qui éloigne de nombreux ingénieurs du RL, démontrant que les concepts sont accessibles lorsqu'ils sont correctement expliqués.

Le guide commence par établir les fondements mathématiques nécessaires, incluant la probabilité, les logarithmes, la valeur attendue et les fonctions de perte, expliqués de manière intuitive avec des exemples numériques détaillés. Il aborde ensuite le problème central : pourquoi les modèles traditionnellement entraînés pour prédire des mots ne sont pas nécessairement utiles ou sûrs, introduisant le concept d'alignement avec les préférences humaines.

Le cœur du document explore la révolution RLHF (Reinforcement Learning from Human Feedback) qui a transformé des modèles comme ChatGPT. Il décrit en détail ses trois étapes : ajustement fin supervisé pour suivre les instructions, entraînement de modèles de récompense basés sur les comparaisons humaines, et optimisation utilisant des algorithmes comme PPO. Il inclut une analyse mathématique complète avec des exemples pas à pas illustrant comment les modèles apprennent à générer des réponses préférées par les humains.

Le texte examine les alternatives modernes comme DPO (Direct Preference Optimization), qui simplifie RLHF en éliminant le besoin de modèles de récompense explicites, réduisant les besoins en mémoire de 50%. Il analyse l'approche révolutionnaire de DeepSeek-R1 qui omet l'ajustement supervisé et applique le RL directement, découvrant spontanément des stratégies de raisonnement étape par étape sans exemples humains explicites.

Il couvre les concepts avancés tels que le scaling de calcul au moment du test (investir plus de calcul pendant l'inférence pour améliorer la précision), les modèles de récompense de processus (PRM) qui évaluent chaque étape du raisonnement plutôt que seulement les résultats finaux, et les algorithmes modernes au-delà de PPO et DPO, incluant GRPO, RLOO, KTO, IPO et ORPO, avec une analyse comparative de leurs avantages.

Le document explore les applications spécifiques par domaine : génération de code avec retour d'exécution, mathématiques avec vérificateurs formels, utilisation d'outils avec signaux de succès d'API, et amélioration du dialogue multi-tours. Il examine les techniques de génération guidée par vérificateur, la recherche arborescente avec Monte Carlo Tree Search, et les stratégies de décodage comme le rejection sampling et la self-consistency.

Destiné aux professionnels de l'IA, chercheurs, ingénieurs et étudiants, le matériel est accessible aux lecteurs lycéens intéressés par l'IA jusqu'aux experts construisant des systèmes de production. Chaque concept est présenté avec des intuitions, des analogies du monde réel, des exemples numériques détaillés et des avertissements sur les pièges courants, permettant trois niveaux de lecture selon les objectifs du lecteur.

Points clés

  • Guide complet de RL pour LLMs avec approche mathématique accessible via format dual.
  • RLHF transforme les modèles par ajustement supervisé, modèles de récompense et optimisation PPO.
  • DPO élimine les modèles de récompense explicites, simplifiant RLHF avec 50% moins de mémoire.
  • DeepSeek-R1 démontre que le raisonnement émerge du RL pur sans ajustement supervisé préalable.
  • Le calcul au moment du test échange temps d'inférence contre précision sans réentraîner le modèle.
  • Les PRM évaluent chaque étape du raisonnement, surpassant les modèles mesurant seulement les résultats finaux.
  • Trois niveaux de lecture : compréhension conceptuelle, implémentation pratique ou recherche avancée.
  • Couvre GRPO, RLOO, KTO, IPO et ORPO avec cas d'usage spécifiques pour chaque algorithme.
  • Applications vérifiables en code, mathématiques, outils et dialogue avec récompenses automatisées.
  • Inclut stratégies avancées : vérificateurs, MCTS, rejection sampling et self-consistency.

Derniers documents

★★★★★
Évaluez-nous sur Google
Ce site utilise des cookies techniques, de personnalisation et d’analyse, propres et tiers, pour faciliter la navigation anonyme et analyser les statistiques d’utilisation du site. Nous considérons que si vous continuez à naviguer, vous acceptez leur utilisation.