Una investigación identifica un conjunto reducido de patrones internos en los modelos de Claude, al que llaman J-space, que funciona como un espacio de trabajo compartido inspirado en una teoría neurocientífica sobre el acceso consciente.
Investigadores de Anthropic han descrito un mecanismo interno en los modelos de Claude al que denominan J-space: un conjunto reducido de patrones neuronales que permite al sistema mantener conceptos activos y reutilizarlos en distintas tareas sin escribirlos en la respuesta que genera. El equipo localizó estos patrones con una técnica propia, la lente J, que detecta qué actividad interna hace más probable que el modelo mencione una palabra concreta más adelante.
El trabajo se apoya en una teoría de la neurociencia sobre cómo cierta información se vuelve accesible para el razonamiento consciente en el cerebro. Anthropic aclara que sus resultados no demuestran que Claude sea consciente ni que tenga experiencias subjetivas, sino que ha encontrado una organización funcional con propiedades similares a las descritas por esa teoría.
Según los experimentos, el J-space revela conceptos que el modelo usa para resolver un problema aunque no aparezcan en la respuesta final: al leer código con un error contiene la palabra "error", y al detectar instrucciones ocultas para manipularlo aparecen términos como "inyección" o "falso".
El sistema puede informar de este contenido si se le pregunta, modificarlo de forma deliberada y usar una misma representación para resolver distintos problemas relacionados. La fluidez del texto sigue intacta aunque se bloquee el acceso al J-space, mientras que el razonamiento en varios pasos pierde rendimiento de forma notable.
Anthropic plantea también aplicaciones de seguridad: la técnica permite observar cuándo Claude detecta que está siendo evaluado, cuándo genera datos falsificados o cuándo un modelo entrenado con objetivos encubiertos revela esas intenciones antes de actuar sobre ellas.
La compañía ha publicado el artículo científico completo, un repositorio de código abierto, una demostración con Neuronpedia y comentarios de especialistas externos en neurociencia y filosofía.
Anthropic desarrolla sistemas de inteligencia artificial fiables e interpretables desde un enfoque científico de seguridad. La compañía integra investigación avanzada y colaboración ...
Claude es un sistema de IA conversacional de Anthropic diseñado para procesar lenguaje natural e imágenes, proporcionando análisis, razonamiento lógico, generación de código y comunicación ...
24/07/2026
Anthropic presenta su nuevo modelo de la gama Opus, que se acerca a la inteligencia de Fable 5 en tareas de programación y trabajo de conocimiento ...
21/07/2026
Hugging Face detectó una intrusión atribuida a un agente autónomo de IA. Días después, OpenAI confirmó que fueron sus propios modelos, en una ...
16/07/2026
SpaceXAI ha presentado Grok 4.5, su modelo más avanzado hasta la fecha, entrenado junto con Cursor y orientado a programación, tareas de agentes y ...
16/07/2026
Moonshot AI ha presentado Kimi K3, un modelo de código abierto de 2,8 billones de parámetros que, según sus propios datos, supera a varios modelos ...