Un espace interne semble organiser le raisonnement des modèles de Claude

06/07/2026

Une étude identifie un petit ensemble de motifs internes dans les modèles de Claude, appelé J-space, qui fonctionne comme un espace de travail partagé inspiré d'une théorie neuroscientifique de l'accès conscient.

Un espace interne semble organiser le raisonnement des modèles de Claude

Des chercheurs d'Anthropic ont décrit un mécanisme interne des modèles de Claude qu'ils appellent le J-space : un petit ensemble de motifs neuronaux qui permet au système de maintenir des concepts actifs et de les réutiliser dans différentes tâches sans les écrire dans sa réponse. L'équipe a repéré ces motifs grâce à une technique propre, la lentille J, qui détecte quelle activité interne rend plus probable que le modèle mentionne un mot précis par la suite.

Ce travail s'appuie sur une théorie des neurosciences qui explique comment certaines informations deviennent accessibles au raisonnement conscient dans le cerveau. Anthropic précise que ses résultats ne démontrent pas que Claude soit conscient ni qu'il ait des expériences subjectives, mais qu'elle a identifié une organisation fonctionnelle aux propriétés proches de celles décrites par cette théorie.

Selon les expériences, le J-space révèle des concepts que le modèle utilise pour résoudre un problème même s'ils n'apparaissent pas dans la réponse finale : en lisant un code contenant une erreur, il contient le mot « erreur », et en détectant des instructions cachées destinées à le manipuler, des termes comme « injection » ou « faux » apparaissent.

Le système peut rendre compte de ce contenu si on l'interroge, le modifier délibérément et utiliser une même représentation pour résoudre différents problèmes liés. La fluidité du texte reste intacte même si l'accès au J-space est bloqué, tandis que le raisonnement en plusieurs étapes perd nettement en performance.

Anthropic évoque aussi des applications de sécurité : la technique permet d'observer quand Claude détecte qu'il est en train d'être évalué, quand il génère des données falsifiées, ou quand un modèle entraîné avec des objectifs cachés révèle ces intentions avant même d'agir.

Points clés

  • Anthropic identifie un mécanisme interne de Claude appelé J-space
  • C'est un petit ensemble de motifs neuronaux qui maintient des concepts actifs sans les écrire
  • Inspiré d'une théorie neuroscientifique de l'accès conscient
  • Anthropic précise que cela ne prouve pas que Claude soit conscient
  • Révèle des concepts internes absents de la réponse finale, comme des erreurs de code ou des tentatives de manipulation
  • Le modèle peut rendre compte de ce contenu et le modifier délibérément
  • Le bloquer n'affecte pas la fluidité du texte mais nuit au raisonnement en plusieurs étapes
  • Permet de détecter quand le modèle simule des évaluations, falsifie des données ou dissimule des objectifs

Vidéos

IA connexe

Anthropic

Systèmes d'IA dignes de confiance

Anthropic développe des systèmes d'intelligence artificielle fiables et interprétables selon une approche scientifique de la sécurité. L'entreprise intègre recherche avancée et collaboration ...

Claude

Créez avec Claude

Claude est un système d'IA conversationnelle d'Anthropic conçu pour traiter le langage naturel et les images, fournissant analyse, raisonnement logique, génération de code et communication ...

Dernières nouvelles

★★★★★
Évaluez-nous sur Google
Ce site utilise des cookies techniques, de personnalisation et d’analyse, propres et tiers, pour faciliter la navigation anonyme et analyser les statistiques d’utilisation du site. Nous considérons que si vous continuez à naviguer, vous acceptez leur utilisation.