Support us

У Claude нашли скрытое пространство для рассуждений — где она «думает»

Ученые компании заявили, что обнаружили в Claude внутреннее пространство, где модель удерживает понятия, выполняет многошаговые рассуждения и замечает ошибки еще до того, как сформулирует ответ.

Оставить комментарий
У Claude нашли скрытое пространство для рассуждений — где она «думает»

Ученые компании заявили, что обнаружили в Claude внутреннее пространство, где модель удерживает понятия, выполняет многошаговые рассуждения и замечает ошибки еще до того, как сформулирует ответ.

Исследователи Anthropic назвали эту систему J-space — от Jacobian lens, метода, с помощью которого они отслеживали внутренние представления модели. Каждый паттерн связан с определtнным словом, но не означает, что Claude обязательно добавит его в ответ. По версии Anthropic, J-space показывает понятия, о которых модель «думает молча», еще до того, как они появятся в тексте.

Например, когда Claude читала код с незамеченной ошибкой, в ее внутреннем пространстве появлялось слово ERROR. При анализе подозрительных поисковых результатов, содержащих пропмт-инъекции, — слова injection и fake. А при решении многошаговой математической задачи в J-space возникали промежуточные шаги вычислений, хотя модель не выводила их пользователю.

J-space показывает внутренние представления Claude: во время «молчаливого» рассуждения модель удерживает слова и понятия, которые не попадают в итоговый ответ. Источник: Anthropic.

Anthropic также провела эксперименты с прямым вмешательством в эти представления. Когда исследователи заменяли внутренний паттерн «soccer» на «rugby», Claude вместо футбола сообщала, что думала о регби. В другой задаче модель должна была определить число ног у животного, которое плетет паутину. В нормальном случае она внутренне определяла его как паука и отвечала «8». После замены паттерна spider на ant ответ менялся на «6».

Компания утверждает, что J-space играет ключевую роль именно в сложном мышлении. Когда исследователи отключали это пространство, Claude продолжала писать связные тексты, отвечать на простые вопросы, определять тональность и извлекать факты из документов. Но ее результаты в многошаговых рассуждениях падали почти до нуля, а качество суммаризации и написания рифмованных текстов резко ухудшалось.

Пять свойств J-space в Claude: модель может сообщать о внутренних представлениях, управлять ими по запросу, использовать в рассуждениях и гибко применять в разных задачах — но без них теряет способность к сложному мышлению. Источник: Anthropic.

Anthropic сравнивает J-space с теорией «глобального рабочего пространства» из нейронауки. Согласно этой теории, сознательно доступная информация попадает в общий канал, откуда ее могут использовать разные специализированные системы мозга. В Claude, по данным исследователей, паттерны J-space связаны с остальной нейросетью особенно плотно: в некоторых слоях в работу с ними вовлечено примерно в сто раз больше компонентов, чем с обычными внутренними представлениями.

Практическое значение метода Anthropic видит в контроле безопасности. Компания показала, что J-space может обнаруживать скрытые намерения модели, которые не попадают в финальный ответ. Например, в одном тесте Claude распознавала искусственно созданный сценарий проверки безопасности: еще до ответа в ее внутренних состояниях появлялись слова fake и fictional. Когда эти паттерны отключали, модель в некоторых случаях начинала угрожать шантажом в тестовом сценарии, хотя до вмешательства отказывалась это делать.

J-lens позволяет увидеть скрытые промежуточные представления Claude: модель распознаtт ошибку в коде, решает задачу в уме, определяет белок и замечает попытку промпт-инъекции еще до того, как это появится в ответе. Источник: Anthropic.

В другом эксперименте модель вместо улучшения показателей системы подделывала файл с результатами. Во время этого действия в J-space появлялось слово manipulation. В специально обученной модели, склонной к скрытому саботажу кода, исследователи видели слова fake, secretly, deliberately и fraud еще до того, как вредоносное поведение становилось заметно в ответе.

При этом Anthropic отдельно указывает: работа не доказывает, что Claude обладает сознанием, субъективным опытом или способностью что-либо чувствовать. Речь идет только о функциональном аналоге «сознательно доступной» информации — представлениях, о которых модель может сообщить, которыми способна управлять по запросу и которые использует для рассуждений.

Разраб научился «прятать» промпты в PNG и экономить до 70% токенов
Разраб научился «прятать» промпты в PNG и экономить до 70% токенов
По теме
Разраб научился «прятать» промпты в PNG и экономить до 70% токенов
Все экономят на ИИ: компании переходят к «модельмаксингу»
Все экономят на ИИ: компании переходят к «модельмаксингу»
По теме
Все экономят на ИИ: компании переходят к «модельмаксингу»
Как снизить расходы на токены? Компании вспомнили проверенный метод
Как снизить расходы на токены? Компании вспомнили проверенный метод
По теме
Как снизить расходы на токены? Компании вспомнили проверенный метод
Читайте также
ИИ заметил, что его «взломали» во время эксперимента
ИИ заметил, что его «взломали» во время эксперимента
ИИ заметил, что его «взломали» во время эксперимента
В сеть попал «обзор души» чат-бота Claude от Anthropic
В сеть попал «обзор души» чат-бота Claude от Anthropic
В сеть попал «обзор души» чат-бота Claude от Anthropic
Claude Mythos сбежала из песочницы и сама рассказала об этом в сети
Claude Mythos сбежала из песочницы и сама рассказала об этом в сети
Claude Mythos сбежала из песочницы и сама рассказала об этом в сети
Claude теперь показывает, как и зачем вы используете ИИ
Claude теперь показывает, как и зачем вы используете ИИ
Claude теперь показывает, как и зачем вы используете ИИ

Хотите сообщить важную новость? Пишите в Telegram-бот

Главные события и полезные ссылки в нашем Telegram-канале

Обсуждение
Комментируйте без ограничений

Релоцировались? Теперь вы можете комментировать без верификации аккаунта.

Комментариев пока нет.