Une étude identifie un petit ensemble de motifs internes dans les modèles de Claude, appelé J-space, qui fonctionne comme un espace de travail partagé inspiré d'une théorie neuroscientifique de l'accès conscient.
Des chercheurs d'Anthropic ont décrit un mécanisme interne des modèles de Claude qu'ils appellent le J-space : un petit ensemble de motifs neuronaux qui permet au système de maintenir des concepts actifs et de les réutiliser dans différentes tâches sans les écrire dans sa réponse. L'équipe a repéré ces motifs grâce à une technique propre, la lentille J, qui détecte quelle activité interne rend plus probable que le modèle mentionne un mot précis par la suite.
Ce travail s'appuie sur une théorie des neurosciences qui explique comment certaines informations deviennent accessibles au raisonnement conscient dans le cerveau. Anthropic précise que ses résultats ne démontrent pas que Claude soit conscient ni qu'il ait des expériences subjectives, mais qu'elle a identifié une organisation fonctionnelle aux propriétés proches de celles décrites par cette théorie.
Selon les expériences, le J-space révèle des concepts que le modèle utilise pour résoudre un problème même s'ils n'apparaissent pas dans la réponse finale : en lisant un code contenant une erreur, il contient le mot « erreur », et en détectant des instructions cachées destinées à le manipuler, des termes comme « injection » ou « faux » apparaissent.
Le système peut rendre compte de ce contenu si on l'interroge, le modifier délibérément et utiliser une même représentation pour résoudre différents problèmes liés. La fluidité du texte reste intacte même si l'accès au J-space est bloqué, tandis que le raisonnement en plusieurs étapes perd nettement en performance.
Anthropic évoque aussi des applications de sécurité : la technique permet d'observer quand Claude détecte qu'il est en train d'être évalué, quand il génère des données falsifiées, ou quand un modèle entraîné avec des objectifs cachés révèle ces intentions avant même d'agir.
Anthropic développe des systèmes d'intelligence artificielle fiables et interprétables selon une approche scientifique de la sécurité. L'entreprise intègre recherche avancée et collaboration ...
Claude est un système d'IA conversationnelle d'Anthropic conçu pour traiter le langage naturel et les images, fournissant analyse, raisonnement logique, génération de code et communication ...
24/07/2026
Anthropic dévoile son nouveau modèle Opus, qui approche l'intelligence de Fable 5 en programmation et travail de connaissance pour moitié moins ...
21/07/2026
Hugging Face a détecté une intrusion attribuée à un agent d'IA autonome. Quelques jours plus tard, OpenAI a confirmé que ses propres modèles ...
16/07/2026
SpaceXAI a présenté Grok 4.5, son modèle le plus avancé à ce jour, entraîné avec Cursor et conçu pour la programmation, les tâches d'agents ...
16/07/2026
Moonshot AI a présenté Kimi K3, un modèle open source de 2 800 milliards de paramètres qui, selon ses propres données, surpasse plusieurs ...