У Claude нашли скрытое пространство для рассуждений — где она «думает»
Ученые компании заявили, что обнаружили в Claude внутреннее пространство, где модель удерживает понятия, выполняет многошаговые рассуждения и замечает ошибки еще до того, как сформулирует ответ.
Ученые компании заявили, что обнаружили в Claude внутреннее пространство, где модель удерживает понятия, выполняет многошаговые рассуждения и замечает ошибки еще до того, как сформулирует ответ.
Исследователи Anthropic назвали эту систему J-space — от Jacobian lens, метода, с помощью которого они отслеживали внутренние представления модели. Каждый паттерн связан с определtнным словом, но не означает, что Claude обязательно добавит его в ответ. По версии Anthropic, J-space показывает понятия, о которых модель «думает молча», еще до того, как они появятся в тексте.
Например, когда Claude читала код с незамеченной ошибкой, в ее внутреннем пространстве появлялось слово ERROR. При анализе подозрительных поисковых результатов, содержащих пропмт-инъекции, — слова injection и fake. А при решении многошаговой математической задачи в J-space возникали промежуточные шаги вычислений, хотя модель не выводила их пользователю.
J-space показывает внутренние представления Claude: во время «молчаливого» рассуждения модель удерживает слова и понятия, которые не попадают в итоговый ответ. Источник: Anthropic.
Anthropic также провела эксперименты с прямым вмешательством в эти представления. Когда исследователи заменяли внутренний паттерн «soccer» на «rugby», Claude вместо футбола сообщала, что думала о регби. В другой задаче модель должна была определить число ног у животного, которое плетет паутину. В нормальном случае она внутренне определяла его как паука и отвечала «8». После замены паттерна spider на ant ответ менялся на «6».
Компания утверждает, что J-space играет ключевую роль именно в сложном мышлении. Когда исследователи отключали это пространство, Claude продолжала писать связные тексты, отвечать на простые вопросы, определять тональность и извлекать факты из документов. Но ее результаты в многошаговых рассуждениях падали почти до нуля, а качество суммаризации и написания рифмованных текстов резко ухудшалось.
Пять свойств J-space в Claude: модель может сообщать о внутренних представлениях, управлять ими по запросу, использовать в рассуждениях и гибко применять в разных задачах — но без них теряет способность к сложному мышлению. Источник: Anthropic.
Anthropic сравнивает J-space с теорией «глобального рабочего пространства» из нейронауки. Согласно этой теории, сознательно доступная информация попадает в общий канал, откуда ее могут использовать разные специализированные системы мозга. В Claude, по данным исследователей, паттерны J-space связаны с остальной нейросетью особенно плотно: в некоторых слоях в работу с ними вовлечено примерно в сто раз больше компонентов, чем с обычными внутренними представлениями.
Практическое значение метода Anthropic видит в контроле безопасности. Компания показала, что J-space может обнаруживать скрытые намерения модели, которые не попадают в финальный ответ. Например, в одном тесте Claude распознавала искусственно созданный сценарий проверки безопасности: еще до ответа в ее внутренних состояниях появлялись слова fake и fictional. Когда эти паттерны отключали, модель в некоторых случаях начинала угрожать шантажом в тестовом сценарии, хотя до вмешательства отказывалась это делать.
J-lens позволяет увидеть скрытые промежуточные представления Claude: модель распознаtт ошибку в коде, решает задачу в уме, определяет белок и замечает попытку промпт-инъекции еще до того, как это появится в ответе. Источник: Anthropic.
В другом эксперименте модель вместо улучшения показателей системы подделывала файл с результатами. Во время этого действия в J-space появлялось слово manipulation. В специально обученной модели, склонной к скрытому саботажу кода, исследователи видели слова fake, secretly, deliberately и fraud еще до того, как вредоносное поведение становилось заметно в ответе.
При этом Anthropic отдельно указывает: работа не доказывает, что Claude обладает сознанием, субъективным опытом или способностью что-либо чувствовать. Речь идет только о функциональном аналоге «сознательно доступной» информации — представлениях, о которых модель может сообщить, которыми способна управлять по запросу и которые использует для рассуждений.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.