Исследовательская группа Anthropic совершила прорыв в понимании внутренней архитектуры больших языковых моделей. В ходе анализа моделей семейства Claude была выявлена структура, которую разработчики не закладывали на этапе проектирования. Речь идет о так называемом «J-space» — внутреннем механизме, функционирующем как общее рабочее пространство, к которому обращаются различные компоненты модели.
Согласно опубликованным данным (исследование от 6 июля), J-space представляет собой виртуальную «доску», где собирается и передается ключевая информация по всей модели. Когда Claude отвечает на вопрос, решает задачу или выполняет инструкцию, критически важные данные появляются в этом пространстве, чтобы разные части модели могли с ними работать. Исследователи использовали инструмент под названием «J-lens», позволяющий наблюдать за перемещением информации внутри модели в реальном времени. Удивительно, но J-space возник спонтанно в процессе обучения — он не был заложен конструкторами напрямую.
Эта концепция удивительным образом перекликается с тем, что в нейронауках называют «глобальным рабочим пространством». У человека эта система обеспечивает доступ к важной информации сразу для нескольких мыслительных процессов. Например, когда человек слышит вопрос, вспоминает нужный факт и решает, как ответить, мозг сводит все необходимые данные в одном месте. Claude работает схожим образом: модель может описывать содержимое J-space по запросу и даже изменять его, если об этом попросить. Более того, когда исследователи вручную меняли J-space, менялись и ответы Claude, и его поведение при выполнении заданий.
Почему это важно для безопасности и интерпретируемости ИИ?
Открытие имеет огромное значение для безопасности искусственного интеллекта. Если ученые смогут отслеживать активность J-space, у них появится шанс выявлять скрытые мотивы в поведении ИИ-моделей. Это позволит эффективнее отмечать моменты, когда система начинает работать ненадежно, в том числе при атаках типа prompt-injection (внедрение вредоносных инструкций в запрос). Даже частичный доступ к такому «осознанному» слою обработки открывает важные перспективы для исследований.
Пока возможности ограничены: большая часть обработки информации у Claude по-прежнему идет вне J-space. Тем не менее, Anthropic уже открыла исходный код реализации J-lens и выложила демоверсию на Neuronpedia, предложив исследовательскому сообществу проверить результаты на практике.
Это исследование опирается на серию более ранних работ. В октябре 2025 года компания опубликовала доклад о формирующейся интроспективной осознанности, а в апреле 2025 года запустила инициативы по изучению благополучия моделей. Важная оговорка: Anthropic подчеркивает, что не заявляет, будто Claude обладает сознанием или субъективным опытом. В работе используется термин «осознанно доступная» информация, заимствованный из когнитивной науки, — он не означает наличия настоящего сознания.
Мнение эксперта: Обнаружение J-space — это не просто академический курьез, а шаг к созданию «белых ящиков» из «черных». Для криптоиндустрии, где ИИ все активнее применяется в анализе рынков и управлении активами, возможность заглянуть в «голову» модели и понять ее мотивы — это вопрос доверия и безопасности. Мониторинг J-space может стать стандартом верификации ИИ-агентов в DeFi.