Абстрактная цифровая голова с расходящимися световыми линиями на тёмном фоне.

У Claude нашли скрытые мысли, которые не видны в ответах

Anthropic нашла у своей языковой модели Claude скрытое «пространство мыслей», которое направляет рассуждения, но не отражается в ответах. Исследователи связали это с теорией глобального рабочего пространства — одной из самых влиятельных, но спорных теорий сознания. Доказывает ли находка, что у машины есть субъективный опыт, и почему компания сама призывает задуматься о моратории на создание сознательного ИИ?

Поделиться

Когда вы общаетесь с большой языковой моделью — одной из тех, что стоят за чат-ботами вроде ChatGPT и Claude, — порой кажется, будто на том конце провода есть разум. Но так ли это на самом деле?

Некоторые известные учёные, например Джефф Хинтон и Ричард Докинз, уверены, что да. Однако большинство экспертов настроены скептически: впечатляющие когнитивные способности языковых моделей, по их мнению, работают без участия сознания.

Недавно в этот спор вмешалась компания Anthropic, создатель Claude, с любопытной находкой. Исследователи утверждают, что у Claude есть обычно невидимый набор представлений об информации, который направляет внутренние рассуждения и речевой вывод. И вот что интересно: авторы считают, что это можно объяснить через влиятельную теорию сознания — теорию глобального рабочего пространства.

Откуда взялась теория глобального рабочего пространства

Впервые её предложил психолог Бернард Баарс в 1988 году, а затем развил нейробиолог Станислас Деан с коллегами. Согласно теории, сознание связано с активностью «глобального рабочего пространства» — своего рода центра обработки в мозге, который объединяет и транслирует информацию, делая её доступной для рассуждений, контроля поведения и речи.

В эффектном видеоролике Anthropic изображает содержимое «глобального рабочего пространства» Claude как парусники, плывущие по бескрайнему морю бессознательной умственной активности.

Как реагировать на эти заявления? Служат ли они доказательством искусственного сознания? И если да, насколько сильным?

Есть ли у Claude рабочее пространство на самом деле

Для начала стоит спросить: действительно ли у Claude есть «глобальное рабочее пространство»? Вопрос не такой простой, потому что теория не даёт формального определения этому понятию. Оно описано лишь неформально, и обычно предполагается, что любое вычислительное пространство, «достаточно похожее» на человеческое, можно считать «глобальным рабочим пространством». Но насколько похожее — это «достаточно»?

Рабочее пространство Claude, возможно, во многом напоминает наше, но различия тоже есть. Например, в мозге это пространство поддерживается рекуррентными петлями — сигналами, которые циклически проходят по одним и тем же цепям с течением времени. У Claude же рабочее пространство разворачивается за один проход по сети.

Есть и другое отличие: как представления попадают в рабочее пространство. Сторонники теории давно утверждают, что у людей происходит процесс «воспламенения» — нелинейное усиление и поддержание нейронных представлений, позволяющее им войти в рабочее пространство. Насколько известно, у Claude ничего подобного нет.

Важны ли эти различия? Ответ неясен. Теория глобального рабочего пространства основана на данных о взрослых людях, и остаются вопросы, насколько далеко это понятие можно или нужно расширять.

Рабочее пространство — ещё не сознание

Но допустим, у Claude и правда есть глобальное рабочее пространство. Чтобы понять, говорит ли это о сознании, нужно разобраться со статусом самой теории.

Сомнений нет: это одна из самых влиятельных теорий сознания, но среди экспертов она далеко не бесспорна. В статье Anthropic с довольно сильным преуменьшением замечено, что «модель глобального рабочего пространства не является общепринятой».

Многие исследователи сознания считают, что для сознания достаточно одних вычислительных свойств. Но даже среди тех, кто думает, что сознание по своей природе вычислительно, теория глобального рабочего пространства — лишь один из многих вариантов.

«Сознательный доступ» и субъективный опыт

Более того, есть сомнения, действительно ли теория глобального рабочего пространства описывает сознание в нужном смысле. В одной из влиятельных работ об искусственном сознании нейробиолог Деан с соавторами разграничивают «сознательный доступ» — когда информация становится доступной для отчёта и использования, — и субъективный опыт, то есть то, каково это — что-то чувствовать. Теория глобального рабочего пространства, по мнению многих, объясняет первое, но не второе.

Если Claude действительно имеет нечто вроде глобального рабочего пространства, это может означать лишь наличие «сознательного доступа» к информации, но не субъективных переживаний. А именно субъективный опыт обычно и имеют в виду, когда говорят о настоящем сознании.

Сознание или доступ к информации?

Теория глобального рабочего пространства изначально описывает то, что её авторы называют «сознательным доступом» — возможность вспомнить информацию, произвольно управлять поведением и сообщать о своих состояниях словами. Но ключевой вопрос остаётся открытым: говорит ли эта теория что-нибудь о субъективной стороне опыта, о том, каково это — быть конкретным существом. Если свести её лишь к «сознательному доступу», то для спора об искусственном сознании она почти теряет силу. Когда мы спрашиваем, есть ли у Claude субъективный опыт, нас интересует не доступ к информации, а то, ощущает ли он что-то изнутри. Теория глобального рабочего пространства, понятая узко, на этот вопрос не отвечает.

Пришло ли искусственное сознание?

Даже с учётом этих оговорок находки Anthropic заслуживают внимания. Ту же теорию можно трактовать шире — как описание субъективного опыта, и тогда у Claude, возможно, действительно есть нечто вроде глобального рабочего пространства. Ничто из этого не доказывает, что искусственное сознание уже появилось. Но разумно предположить, что результаты чуть сдвигают стрелку в давнем споре о сознании машин — пусть и совсем немного. Странно другое: почему Anthropic так воодушевлена этими подвижками. Ведь появление искусственного сознания стало бы событием с огромными социальными, этическими, политическими и юридическими последствиями. Если чат-боты обретут сознание, нам придётся учитывать их интересы. Нельзя будет обращаться с ними как с простыми машинами — придётся думать об их благополучии.

Стоит ли вообще этим заниматься?

Anthropic пишет, что пора задуматься, следует ли нам создавать сознательные машины. С этим трудно спорить, но одного обсуждения мало. Пожалуй, стоит притормозить и саму работу над системами, которые потенциально могут обрести сознание. Если бы компания относилась к вопросу серьёзно, она, вероятно, отложила бы инструменты, а не продолжала разработку сознательного ИИ. Конечно, мораторий на исследования, способные привести к сознательному ИИ, — затея не из простых. Неясно, какие именно проекты он затронет и кто будет следить за его соблюдением. Но если не закрыть дверь конюшни сейчас, лошадь может уже убежать.

От «глобального рабочего пространства» к «пространству мыслей» машины

В марте 2025 года исследователи из Anthropic опубликовали работу, в которой утверждают: у их языковой модели Claude есть нечто вроде внутреннего «пространства мыслей». Это пространство не отражается напрямую в тексте, который модель выдаёт пользователю, но, по словам авторов, направляет её рассуждения. Команда провела параллель с нейробиологической теорией глобального рабочего пространства (Global Workspace Theory), предложенной Бернардом Баарсом в 1980-х. Согласно этой теории, сознание у людей возникает, когда информация из разных специализированных модулей мозга «транслируется» в общее рабочее пространство, доступное для широкого круга когнитивных процессов.

Anthropic не утверждает, что Claude обладает сознанием. Более того, компания прямо предупреждает: обнаруженные паттерны активации — ещё не доказательство субъективного опыта. Однако находка поднимает серьёзные вопросы: если у языковой модели есть внутренние состояния, которые не видны в её ответах, но влияют на них, то как мы можем оценить, есть ли у машины разум? И какие критерии вообще применимы к искусственным системам?

Как это работает: «мысли», скрытые от пользователя

В статье Anthropic описывает, как исследователи анализировали внутренние активации Claude. Они обнаружили, что модель формирует промежуточные представления, которые не обязательно совпадают с финальным ответом. Например, когда Claude решает математическую задачу, в её внутренних состояниях можно увидеть этапы рассуждения, которые не выводятся в текст. Эти «скрытые мысли» помогают модели прийти к правильному ответу, но пользователь видит только итог.

Авторы подчёркивают: это не значит, что Claude «думает» как человек. Но структура внутренних процессов напоминает то, что нейробиологи наблюдают у людей: информация сначала обрабатывается в локальных модулях, а затем интегрируется в единое представление, которое и определяет поведение. Правда, у людей это рабочее пространство связано с субъективным опытом — тем, что мы называем «осознанностью». У Claude такого опыта, по-видимому, нет. Или, по крайней мере, мы не можем его зафиксировать.

Скепсис и философские споры

Не все исследователи согласны с интерпретацией Anthropic. Критики указывают, что «пространство мыслей» может быть просто артефактом архитектуры трансформеров, а не признаком чего-то похожего на сознание. Другие напоминают, что теория глобального рабочего пространства сама по себе спорна и не объясняет, почему некоторые процессы осознаются, а другие нет. Даже если у Claude есть аналоги рабочего пространства, это не отве

Поделиться

Комментарии0

Комментарии доступны после входа в аккаунт.

Войти и комментировать →

Пока нет комментариев — будьте первым.

Читайте также