Identifican en los modelos de Claude un espacio interno que organiza su razonamiento

06/07/2026

Una investigación identifica un conjunto reducido de patrones internos en los modelos de Claude, al que llaman J-space, que funciona como un espacio de trabajo compartido inspirado en una teoría neurocientífica sobre el acceso consciente.

Identifican en los modelos de Claude un espacio interno que organiza su razonamiento

Investigadores de Anthropic han descrito un mecanismo interno en los modelos de Claude al que denominan J-space: un conjunto reducido de patrones neuronales que permite al sistema mantener conceptos activos y reutilizarlos en distintas tareas sin escribirlos en la respuesta que genera. El equipo localizó estos patrones con una técnica propia, la lente J, que detecta qué actividad interna hace más probable que el modelo mencione una palabra concreta más adelante.

El trabajo se apoya en una teoría de la neurociencia sobre cómo cierta información se vuelve accesible para el razonamiento consciente en el cerebro. Anthropic aclara que sus resultados no demuestran que Claude sea consciente ni que tenga experiencias subjetivas, sino que ha encontrado una organización funcional con propiedades similares a las descritas por esa teoría.

Según los experimentos, el J-space revela conceptos que el modelo usa para resolver un problema aunque no aparezcan en la respuesta final: al leer código con un error contiene la palabra "error", y al detectar instrucciones ocultas para manipularlo aparecen términos como "inyección" o "falso".

El sistema puede informar de este contenido si se le pregunta, modificarlo de forma deliberada y usar una misma representación para resolver distintos problemas relacionados. La fluidez del texto sigue intacta aunque se bloquee el acceso al J-space, mientras que el razonamiento en varios pasos pierde rendimiento de forma notable.

Anthropic plantea también aplicaciones de seguridad: la técnica permite observar cuándo Claude detecta que está siendo evaluado, cuándo genera datos falsificados o cuándo un modelo entrenado con objetivos encubiertos revela esas intenciones antes de actuar sobre ellas.

La compañía ha publicado el artículo científico completo, un repositorio de código abierto, una demostración con Neuronpedia y comentarios de especialistas externos en neurociencia y filosofía.

Puntos clave

  • Anthropic identifica un mecanismo interno en Claude llamado J-space
  • Es un reducido conjunto de patrones neuronales que mantiene conceptos activos sin escribirlos
  • Inspirado en una teoría neurocientífica sobre el acceso consciente
  • Anthropic aclara que no demuestra que Claude sea consciente
  • Revela conceptos internos ausentes en la respuesta final, como errores en código o intentos de manipulación
  • El modelo puede informar sobre este contenido y modificarlo deliberadamente
  • Bloquearlo no afecta la fluidez del texto pero sí el razonamiento en varios pasos
  • Permite detectar cuándo el modelo simula evaluaciones, falsea datos u oculta objetivos

Vídeos

IA relacionada

Anthropic

Sistemas de IA en los que confiar

Anthropic desarrolla sistemas de inteligencia artificial fiables e interpretables desde un enfoque científico de seguridad. La compañía integra investigación avanzada y colaboración ...

Claude

Crea con Claude

Claude es un sistema de IA conversacional de Anthropic diseñado para procesar lenguaje natural e imágenes, proporcionando análisis, razonamiento lógico, generación de código y comunicación ...

Últimas noticias

★★★★★
Valóranos en Google
Esta web utiliza cookies técnicas, de personalización y análisis, propias y de terceros, para facilitarle la navegación de forma anónima y analizar estadísticas del uso de la web. Consideramos que si continúa navegando, acepta su uso.