Исследовательская группа Anthropic совершила прорыв, обнаружив внутри своей языковой модели Claude ранее неизвестную внутреннюю структуру. Этот механизм, названный «J-space», функционирует как общее рабочее пространство, к которому обращаются различные компоненты модели. Важно подчеркнуть: инженеры не закладывали эту архитектуру в проект при разработке — она возникла спонтанно в процессе обучения.
Что такое J-space и как он работает?
По своей сути, J-space — это внутреннее виртуальное пространство, где Claude собирает и передает ключевые данные по всей модели. Его можно представить как своего рода «доску» внутри искусственного интеллекта. Когда модель отвечает на вопрос или решает задачу, критически важная информация появляется в J-space, чтобы разные части модели могли с ней взаимодействовать. Ученые выявили эту структуру с помощью специального инструмента «J-lens», который позволяет наблюдать за перемещением информации во время выполнения задания.
Примечательно, что J-space во многом повторяет концепцию «глобального рабочего пространства» в человеческом мышлении. Когда человек слышит вопрос, вспоминает нужный факт и решает, как ответить, его мозг сводит все необходимые данные в одном месте. Claude работает схожим образом. Более того, исследователи продемонстрировали, что модель может описывать содержимое J-space по запросу и даже изменять его, если об этом попросить. Ручное вмешательство в J-space напрямую влияло на ответы и поведение модели.
Почему это меняет правила игры для безопасности ИИ
Это открытие имеет колоссальное значение для безопасности и интерпретируемости искусственного интеллекта. Возможность отслеживать активность J-space открывает путь к выявлению скрытых мотивов в поведении моделей. Мы сможем эффективнее замечать моменты, когда система начинает работать ненадежно. В частности, мониторинг J-space позволяет увидеть попытки prompt-инъекций — внедрения вредоносных инструкций в запрос для перехвата управления ответом модели.
Конечно, возможности пока ограничены. Большая часть обработки информации у Claude по-прежнему происходит вне J-space. Тем не менее, Anthropic уже опубликовала исходный код реализации J-lens и выложила демо-версию на Neuronpedia, предложив исследовательскому сообществу проверить результаты на практике.
Это исследование опирается на серию более ранних работ. В октябре 2025 года Anthropic опубликовала доклад о формирующейся интроспективной «осознанности» моделей, а в апреле запустила инициативы по изучению их благополучия. Важная оговорка: компания не заявляет, что Claude обладает сознанием или субъективным опытом. Термин «осознанно доступная» информация заимствован из когнитивной науки и не подразумевает наличия настоящего сознания.
Комментарий эксперта Cryptalist: Обнаружение J-space — это не просто академический курьез. Это шаг к созданию «рентгеновского аппарата» для нейросетей. Возможность заглянуть в «черный ящик» принятия решений — ключ к построению по-настоящему безопасных и подконтрольных систем ИИ, что критически важно для их интеграции в финансовые и управленческие процессы.