Внутри Claude нашли скрытое пространство для рассуждений — это не сознание

Внутри Claude нашли скрытое пространство для рассуждений — это не сознание

Ученые из компании Anthropic, разработавшей языковую модель Claude, обнаружили внутри нее скрытое рабочее пространство для рассуждений. Оно получило название J-space и представляет собой набор внутренних нейронных состояний, которые не видны пользователю, но влияют на ответы модели. Исследование не доказывает наличие у ИИ сознания, но показывает, как нейросеть обрабатывает сложную информацию.

Для обнаружения скрытых процессов команда применила новый метод анализа — Jacobian lens (J-lens). Он основан на математическом понятии якобиана, которое описывает, как изменение одного элемента системы влияет на другие. Метод позволил сопоставить внутренние паттерны активности с конкретными понятиями, даже если эти понятия не появляются в тексте ответа.

Так, когда Клода просили назвать количество ног у животного, которое плетет паутину, модель сначала активировала понятие «паук», хотя в ответе его не было. Ход рассуждений оставался внутри системы. Чтобы проверить, участвуют ли эти состояния в формировании ответа, исследователи провели прямые вмешательства. Например, при выборе вида спорта из заданной категории они заменили внутренний паттерн «футбол» на «регби» — и модель соответственно изменила ответ.

Подобный эксперимент с задачей про паука показал, что замена понятия «паук» на «муравей» заставила модель ошибочно назвать шесть ног вместо восьми. Это доказывает, что J-space является частью причинной цепочки рассуждений, а не просто пассивным отражением уже принятого решения. Более того, одно и то же внутреннее представление (например, «Франция») может одновременно влиять на разные аспекты ответа — столицу, язык, валюту — и при замене на «Китай» меняются все соответствующие параметры.

Такая организация напоминает теорию глобального рабочего пространства, которая объясняет, как информация становится доступной для сознательного контроля в мозге человека. Однако авторы исследования подчеркивают, что у Claude нет субъективных переживаний или сознания. Открытие скорее показывает, что современные языковые модели могут самостоятельно формировать внутренние структуры для сложных когнитивных операций, что важно для понимания принципов работы ИИ и его интерпретируемости.