Una investigació identifica un conjunt reduït de patrons interns en els models de Claude, anomenat J-space, que funciona com un espai de treball compartit inspirat en una teoria neurocientífica sobre l'accés conscient.
Investigadors d'Anthropic han descrit un mecanisme intern en els models de Claude anomenat J-space: un conjunt reduït de patrons neuronals que permet al sistema mantenir conceptes actius i reutilitzar-los en diverses tasques sense escriure'ls a la resposta que genera. L'equip va localitzar aquests patrons amb una tècnica pròpia, la lent J, que detecta quina activitat interna fa més probable que el model mencioni una paraula concreta més endavant.
El treball es recolza en una teoria de la neurociència sobre com certa informació esdevé accessible per al raonament conscient al cervell. Anthropic aclareix que els seus resultats no demostren que Claude sigui conscient ni que tingui experiències subjectives, sinó que ha trobat una organització funcional amb propietats similars a les descrites per aquesta teoria.
Segons els experiments, el J-space revela conceptes que el model utilitza per resoldre un problema encara que no apareguin a la resposta final: en llegir codi amb un error conté la paraula "error", i en detectar instruccions ocultes per manipular-lo apareixen termes com "injecció" o "fals".
El sistema pot informar d'aquest contingut si se li pregunta, modificar-lo de manera deliberada i utilitzar una mateixa representació per resoldre diferents problemes relacionats. La fluïdesa del text es manté intacta encara que es bloquegi l'accés al J-space, mentre que el raonament en diversos passos perd rendiment de manera notable.
Anthropic planteja també aplicacions de seguretat: la tècnica permet observar quan Claude detecta que està sent avaluat, quan genera dades falsificades o quan un model entrenat amb objectius encoberts revela aquestes intencions abans d'actuar-hi.
Anthropic desenvolupa sistemes d'intel·ligència artificial fiables i interpretables des d'un enfocament científic de seguretat. La companyia integra recerca avançada i col·laboració ...
Claude és un sistema d'IA conversacional d'Anthropic dissenyat per processar llenguatge natural i imatges, proporcionant anàlisi, raonament lògic, generació de codi i comunicació multilingüe ...
08/09/2026
Meta presenta Muse, un agent d'intel·ligència artificial que no només respon preguntes, sinó que executa tasques i projectes en nom de l'usuari, ...
04/09/2026
OpenAI presenta GPT-6 Astra, un model que millora l'ús d'ordinador, el treball professional, la programació i la ciberseguretat, i que respecta ...
03/09/2026
xAI amplia Grok Bot, els seus agents d'intel·ligència artificial capaços de treballar de forma autònoma dins d'aplicacions i eines, a les ...
27/08/2026
Un centenar i mig d'organitzacions tecnològiques, bancs i empreses de ciberseguretat signen una carta publicada per OpenAI que adverteix d'un ...