Identifiquen en els models de Claude un espai intern que organitza el seu raonament

06/07/2026

Una investigació identifica un conjunt reduït de patrons interns en els models de Claude, anomenat J-space, que funciona com un espai de treball compartit inspirat en una teoria neurocientífica sobre l'accés conscient.

Identifiquen en els models de Claude un espai intern que organitza el seu raonament

Investigadors d'Anthropic han descrit un mecanisme intern en els models de Claude anomenat J-space: un conjunt reduït de patrons neuronals que permet al sistema mantenir conceptes actius i reutilitzar-los en diverses tasques sense escriure'ls a la resposta que genera. L'equip va localitzar aquests patrons amb una tècnica pròpia, la lent J, que detecta quina activitat interna fa més probable que el model mencioni una paraula concreta més endavant.

El treball es recolza en una teoria de la neurociència sobre com certa informació esdevé accessible per al raonament conscient al cervell. Anthropic aclareix que els seus resultats no demostren que Claude sigui conscient ni que tingui experiències subjectives, sinó que ha trobat una organització funcional amb propietats similars a les descrites per aquesta teoria.

Segons els experiments, el J-space revela conceptes que el model utilitza per resoldre un problema encara que no apareguin a la resposta final: en llegir codi amb un error conté la paraula "error", i en detectar instruccions ocultes per manipular-lo apareixen termes com "injecció" o "fals".

El sistema pot informar d'aquest contingut si se li pregunta, modificar-lo de manera deliberada i utilitzar una mateixa representació per resoldre diferents problemes relacionats. La fluïdesa del text es manté intacta encara que es bloquegi l'accés al J-space, mentre que el raonament en diversos passos perd rendiment de manera notable.

Anthropic planteja també aplicacions de seguretat: la tècnica permet observar quan Claude detecta que està sent avaluat, quan genera dades falsificades o quan un model entrenat amb objectius encoberts revela aquestes intencions abans d'actuar-hi.

Punts clau

  • Anthropic identifica un mecanisme intern a Claude anomenat J-space
  • És un conjunt reduït de patrons neuronals que manté conceptes actius sense escriure'ls
  • Inspirat en una teoria neurocientífica sobre l'accés conscient
  • Anthropic aclareix que no demostra que Claude sigui conscient
  • Revela conceptes interns absents de la resposta final, com errors de codi o intents de manipulació
  • El model pot informar sobre aquest contingut i modificar-lo deliberadament
  • Bloquejar-lo no afecta la fluïdesa del text però sí el raonament en diversos passos
  • Permet detectar quan el model simula avaluacions, falsifica dades o oculta objectius

Vídeos

IA relacionada

Anthropic

Sistemes d'IA en els quals confiar

Anthropic desenvolupa sistemes d'intel·ligència artificial fiables i interpretables des d'un enfocament científic de seguretat. La companyia integra recerca avançada i col·laboració ...

Claude

Crea amb Claude

Claude és un sistema d'IA conversacional d'Anthropic dissenyat per processar llenguatge natural i imatges, proporcionant anàlisi, raonament lògic, generació de codi i comunicació multilingüe ...

Últimes noticies

★★★★★
Valora'ns a Google
Aquest lloc web utilitza cookies tècniques, de personalització i anàlisi, pròpies i de tercers, per facilitar la navegació anònima i analitzar estadístiques d’ús del web. Considerem que si continueu navegant, n’accepteu l’ús.