
Полная версия
Цифра и интеллект. 50 сюжетов об искусственном интеллекте
В публикации Лекун утверждает, что человекоподобный ИИ должен уметь предсказывать последствия ряда действий, чтобы иметь возможность рассуждать и планировать, а также раскладывать сложную задачу на подзадачи. СовременныеLLMдемонстрируют великолепные способности в рассуждениях, обосновании своих действий, разделении сложных задач на подзадачи.
Далее ученый предлагает концепцию архитектурной модели, которая, по его мнению, может воспроизводить полноценную разумную деятельность человека. Называет он ее автономны машинный интеллект. В своей концепции Лекун выделяет компоненты для таких функций как восприятие, формирование представлений об окружающем мире, мотивация, кратковременная память, оценка прошлого опыта.
Некоторые компоненты можно настраивать на лету – их точная функция определяется компонентом настройки. Роль компонента настройки заключается в конфигурировании параметров остальных компонентов для решения конкретной задачи. Он получает от них данные и настраивает их параметры (схемы внимания) для согласованного выполнения текущей задачи.
Компонент восприятияполучает сигналы от датчиков и оценивает текущее состояние окружающего мира. При этом в каждый момент он воспринимает лишь актуальные и полезные данные, необходимы для решения задачи (это происходит за счет оперативной работы компонента настройки). Далее компонент восприятия представляет полученную модель мира в иерархическом виде с несколькими уровнями абстракции. По сути, это лишь представление об изменениях в основном компоненте, который отвечает за модель мира.
Компонент модели мира– наиболее сложная часть архитектуры. Во-первых, он должен представлять и оценивать недостающую информации об окружающем мире, когда она не поступает от компонента восприятия. Во-вторых, компонент модели мира прогнозирует вероятные состояния окружающего мира в ближайшем и более отдаленном будущем. То есть, компонент должен прогнозировать естественное развитие окружающего мира в результате последовательности действий автономного машинного интеллекта.
Компонент должен прогнозировать несколько вероятных состояний в зависимости от параметров, которые отражают неопределённость окружающего мира. Модель мира – это своего рода симулятор, который подстраивает аспекты окружающего мира под поставленную задачу, делает их релевантными друг другу.
Прогнозы компонент должен выполнять в абстрактном пространстве представлений. В идеале модель мира должна позволять манипулировать представлениями о состоянии мира на нескольких уровнях абстракции в нескольких временных масштабах.
Ключевая проблема, по мнению Лекуна, заключается в том, что компонент модели мира должен отображать несколько возможных прогнозов состояния мира. Это объясняется двумя факторами. В окружающем мире действуют другие разумные агенты, поведение которых далеко не всегда предсказуемо. Но даже если в окружающем мире есть только неодушевлённые объекты, их поведение часто хаотично и поэтому тоже непредсказуемо.
Как отмечает Лекун, при создании автономного машинного интеллекта необходимо ответить на несколько важных вопросов:
как компонент модели мира будет делать несколько правдоподобных прогнозов?
как в прогнозах должна отображаться неопределённость?
как обучать компонент модели мира?
Далее Лекун предлагает ввести в архитектуру два компонента, которые должны стать альтернативой эмоционально-мотивационной сферы человека. Их он называет компонент внутренней стоимостии компонент обучаемого критика.
Компонент внутренней стоимости должен вычислять параметр, который характеризует уровень комфорта/дискомфорта автономного машинного интеллекта при прогнозировании и принятии тех или иных решений. По сути, речь идет об имитации чувств страдания или удовлетворения, присущих каждому человеку.
Входными данными для компонента внутренней стоимости являются текущее состояние мира, полученное с помощью модуля восприятия, и потенциальные будущие состояния, прогнозируемые компонентом модели мира. В самом компоненте внутренней стоимости должны быть заложены поведенческие стимулы и внутренняя мотивация автономного машинного интеллекта. Они должны определять «плохое» и «хорошее», мотивировать самостоятельность и любознательность, помогать проявлять эмпатию при взаимодействии с людьми, ограждать от угроз и опасностей. Конечная цель автономного машинного интеллекта – минимизировать внутреннюю стоимость в долгосрочной перспективе.
Компонент обучаемого критикапрогнозирует будущие значения параметра внутренней стоимости. Он получает на вход текущее состояние мира и его возможные прогнозные состояния. Далее компонент на основе прошлого опыта вычисляет внутреннюю стоимость для разных прогнозов. Это позволяет автономному машинному интеллекту выбирать действия, ведущие к наилучшему прогнозному результату. Для обучения компонент извлекает из памяти прошлые состояния и соответствующие им значения внутренней стоимости.
Компонент кратковременной памятихранит важную информацию о прошлом, настоящем и будущем состоянии мира, а также соответствующие значения внутренней стоимости. Здесь, конечно, возникает вопрос, почему Лекун назвал эту память кратковременной. Более уместно было название компонент долговременной памяти.
Исполнительный компонентна основании работы всех остальных компонентов определяет последовательность действий и выдает действия исполнителям. Последовательность действий должна предусматривать минимизацию значений внутренней стоимости.
Из краткого описания архитектуры автономного машинного интеллекта, предложенной одним из отцов основателей ИИ, видно, что это предельно общие представления, вызывающие законный скепсис. Мы привели эту концепцию по трем причинам.
Во-первых, это мнение человека, который лучше подавляющего большинства ИИ-экспертов понимает внутреннюю природу и потенциальные ограничения современного генеративного ИИ. Во-вторых, это, по сути, первое предсказание о принципиальных ограниченияхLLM, сделанное еще до их появления в публичном пространстве. В-третьих, многие эксперты сегодня, по прошествии нескольких революционных лет, сходятся во мнении, что архитектуру генеративного ИИ нужно дополнять принципиально новыми компонентами.
Резюме. Ян Лекун изложил концепцию, в которой предлагает исследователям искать технологические решения, аналогичные созданным природой структурам человеческого мозга. Это не замена традиционных исследований, которые дают небывалые практические результаты. Это параллельный путь к созданию сильного ИИ. По-прежнему еще очень далекий от воплощения.
Сюжет 22.
AGI
– два подхода к пониманию и оценке
Интеллект всегда побеждает.
Мартин Скорсезе
Общий ИИ (Artificial General Intelligence, AGI) – одна из самых противоречивых тем в современных дискуссиях об искусственном интеллекте. Противоречий много. Противоречие между старым термином (сильный ИИ) и относительно новым (общий ИИ). Противоречие между широкой публичностью темы и ее понятийной размытостью. Противоречие между подходами к оценке AGI– только по результату интеллектуальной деятельности или же еще и по механизмам реализации. Противоречие между подходами к созданию, между оптимистичными и пессимистичными сроками появления, между манипуляциями разных игроков рынка ИИ.
При этом AGI– одна из самых обсуждаемых и волнительных тем. Появление полноценного AGIнесет плохо представимые возможности и угрозы для людей, организаций и человечества в целом. AGI– это тема, в которой крайне желательно объективно разобраться, не впадая в крайности шапкозакидательства и критиканства.
Начнем с терминологии.
На заре исследований в области ИИ в обиход вошли два термина. Слабый ИИ– ИИ, способный решать лишь отдельные интеллектуальные задачи, подвластные человеку. Сильный ИИ– ИИ, не уступающий человеку по когнитивным способностям (полный аналог человеческого интеллекта). Слабым ИИ занимались исследователи, которые постепенно расширяли спектр задач для него. Сильным ИИ занимались футурологи и фантасты, которые регулярно пугали впечатлительных людей ИИ-Армагеддоном.
Впервые термин общий ИИ(AGI) появился в 1997 году в статье о военных системах, но тогда он не вышел за пределы узкого круга экспертов. Известность термин AGIполучил в начале XXI века после публикации книги «Artificial General Intelligence» под редакцией американского ученого Бена Герцеля. В книге AGIопределялся как компьютерная система, которая сможет эффективно решать интеллектуальные задачи на человеческом уровне.
Успехи специализированных нейросетей во втором десятилетии XXI века подогревали интерес к AGI, но по-прежнему в большей степени стараниями футурологов и фантастов. Только революция генеративного ИИ, начавшаяся в конце 2022 года, вывела дискуссии об AGIв широкое публичное пространство. Успехи LLMпозволили лидерам ИИ-отрасли всерьез говорить о том, что до появления AGIостались считанные годы. Мы уже упоминали знаменитое предсказание Илона Маска, что AGIпоявится в 2025 году (не появился).
И здесь мы переходим к главной проблеме дискуссий об AGI. Ее участники категорически не готовы договориться о более-менее едином понимании, что же это такое – общий ИИ. Поэтому для дальнейшего погружения в тему рассмотрим два подхода к пониманию AGI, которые различаются принципиально.
Первый подход основывается на критерии собаки: если что-то лает, кусается и выглядит как собака, это собака и есть. Человек в своей повседневной деятельности решает множество интеллектуальных задач. Если ИИ cможет решать их вместо него – это без всяких сомнений будет AGI. Механизмы решения могут быть любыми, они вообще к теме AGIне относятся. Ими должны заниматься ИИ-разработчики, перед которыми стоит стратегическая задача – научить компьютерные системы решать все те задач, что сегодня решают люди.
Этого подхода придерживаются лидеры практически все ведущих игроков ИТ-отрасли во главе с Сэмом Альтманом и Илоном Маском. Их аргументация понятна и убедительна. Современные LLMи экосистемы ИИ-агентов на их основе все успешнее решают все более широкий круг интеллектуальных задач, являвшихся ранее привилегией людей. В горизонте нескольких лет можно ожидать, что компьютерные системы на основе ИИ смогут решать любую конкретную задачу. И значит – появление AGIдействительно можно ожидать в ближайшее время.
Понятно, почему таких взглядов на AGIпридерживаются ИИ-лидеры. Во-первых, это вполне логично. Во-вторых, это основано на впечатляющих результатах LLM. В-третьих, говорить что-то другое нельзя, так как сотни миллиардов инвестиций нужно оправдывать. Если не текущими прибылями, то хотя бы завтрашними ожиданиями.
Второй подход предполагает, что AGIможно назвать только тот ИИ, который способен воспроизводить все когнитивные способности человека. Не обязательно на основе таких же механизмов, на которых работает человеческий мозг, но обязательно в полном объеме и в любом сочетании. И вот тут при погружении в тему выясняется, что до AGIпримерно столько же, сколько по оценкам футурологов было до сильного ИИ в 1960 году – четверть века (точнее – непонятно, сколько).
Мы уже писали о взглядах на AGIЯна Лекуна, лидера исследований в области ИИ корпорации Meta4[4]. Они как раз относятся ко второму подходу. Можно сказать, что у этих взглядов тоже есть внешняя причина – корпорация пока отстает от признанных лидеров ИИ-гонки и ей выгодно охлаждение перегретых ожиданий.
Однако вряд ли дело только в этом. Лекун предложил свою концепцию автономного машинного интеллекта еще до того, как чат-бот OpenAIпокорил мир. Есть еще один довод, который обосновывает правомочность второго подхода.
В 2025 году со своими согласованными взглядами на AGIвыступил альянс крупнейших исследовательских центров и ведущих университетов, которые занимаются проблемами ИИ. В их числе University of California, Stanford University, University of Oxford, Carnegie Mellon University, Massachusetts Institute of Technology, Center for AI Safetyи еще около десятка организаций.
Альянс опубликовал исследование, в котором изложил понимание участников, что такое AGI, и впервые описал детальный подход к тому, как оценивать компьютерные системы на близость к общему ИИ. Изложенная в исследовании позиция имеет изъяны, и тем не менее это наиболее детальная, не ангажированная и применимая на практике концепция, задающая направление перспективных разработок.
Предлагаемая концепция основана на эмпирически проверенной модели человеческих когнитивных способностей. Модель не является абсолютной истиной, у нее есть критики. И теме не менее в ее основе синтез столетних исследований когнитивных способностей с помощью специальных тестов. Такой богатый практический опыт позволил собрать обширный арсенал тестов, специально разработанных для измерения этих отдельных когнитивных компонентов у людей. Авторы исследования предложили использовать эту модель и этот опыт для определения AGIи его детальной оценки.
Для подтверждения практической применимости своей концепции авторы исследования провели тестирование двух версий чат-бота OpenAI: ChatGPT-4и ChatGPT-5. Забегая вперед, отметим, что по результатам тестирования исследователи оценили результат ChatGPT-4в 27% от того, что должен был бы показывать AGI, а результат ChatGPT-5– в 57%.
Далее приведем структуру когнитивных способностей, предложенную в концепции, и результаты чат-ботов по каждому компоненту. Всего в структуре когнитивных способностей человека выделено 10 основных компонентов. Для простоты для каждого компонента выделено 10% вклада в общий результат. После краткого описания каждого компонента приведем результаты чат-ботов, которые они показали на тестах по каждому компоненту.
Общее знание: широта фактического понимания мира, охватывающая здравый смысл, культуру, науку, социальные науки и историю.
GPT-4= 8% и ChatGPT-5= 9% (из возможных 10%).
Чтение и письмо: уровень владения письменным языком, от базового декодирования до сложного понимания, композиции и использования.
GPT-4= 6% и ChatGPT-5= 10% (из возможных 10%).
Математические способности: глубина математических знаний и навыков в области арифметики, алгебры, геометрии, вероятности и математического анализа.
GPT-4= 4% и ChatGPT-5= 10% (из возможных 10%).
Мгновенные (спонтанные) рассуждения: гибкое управление вниманием для решения новых задач без опоры на ранее усвоенные схемы, проверяемое через дедукцию и индукцию.
GPT-4= 0% и ChatGPT-5= 7% (из возможных 10%).
Рабочая память: способность сохранять и обрабатывать информацию в активном внимании в текстовых, аудиальных и визуальных модальностях.
GPT-4= 2% и ChatGPT-5= 4% (из возможных 10%).
Хранение долговременной памяти: возможность постоянно усваивать и хранить новую информацию (ассоциативную, значимую и дословную).
GPT-4= 0% и ChatGPT-5= 0% (из возможных 10%).
Извлечение из долговременной памяти: точность и быстрота доступа к хранимым знаниям, включая критическую способность избегать галлюцинаций.
GPT-4= 4% и ChatGPT-5= 4% (из возможных 10%).
Визуальное восприятие: способность сканировать, воспринимать, анализировать и генерировать визуальную информацию, распознавать в ней аномалии.
GPT-4= 0% и ChatGPT-5= 4% (из возможных 10%).
Аудиальное восприятие: способность различать, распознавать и творчески работать с аудиальными сигналами и стимулами, включая речь, ритм и музыку.
GPT-4= 0% и ChatGPT-5= 6% (из возможных 10%).
Скорость: способность быстро воспринимать и понимать любые виды информации, выполнять простые когнитивные задачи.
GPT-4= 3% и ChatGPT-5= 3% (из возможных 10%).
Если к этим результатам подходить из общих соображений, они представляются вполне достойными. Во-первых, формально 57% ChatGPT-5– это больше половины пути к AGI. Во-вторых, значителен прогресс между версиями – 30% (можно считать, что это прогресс за 1 год). Если он сохранится, то два года – и путь к AGIбудет пройден.
Но все не так оптимистично, если всматриваться в детали. О чем и говорят сами исследователи. Даже последняя версия демонстрирует сильно неравномерный когнитивный профиль. ChatGPT-5показывает высокую эффективность в компонентах, которые используют обширные обучающие данные (общее знание, чтение и письмо, математические способности). Одновременно у нее есть критические дефекты, конкретные узкие места, затрудняющие дальнейший путь к AGI.
Ключевая проблема – хранение долгосрочной памяти, которая лежит в основе непрерывного обучения. Без непрерывного обучения ИИ должен заново изучать контекст при каждом взаимодействии. Расширение контекстного окна, о котором мы рассказывали ранее, не решает, а лишь сглаживает проблему. При этом постоянное обновление контекста требует значительных вычислительных ресурсов.
Предлагаемая в исследовании концепция обладает, на наш взгляд, одним существенным недостатком. В составе компонентов нет ничего, что напрямую связано с механизмами обучения. А ведь ключевая способность, которую приписывают AGIмногие эксперты, – способность обучаться на собственном опыте без вмешательства человека. При обучении долговременная память человека работает не механически, а интеллектуально. В ней хранится не мешанина фактов, а целостная иерархическая картина мира. Пусть даже у большинства людей она с множеством пробелов, неточностей, ошибок и заблуждений.
В концепции есть и другие пробелы, например, связанные с мотивацией и целеполаганием, эмоциональным интеллектом, прогнозированием будущего. Однако концепция, предложенная экспертами ведущих исследовательских центров и университетов, обладает несколькими преимуществами, которые выводят ее на лидерские позиции в понимании AGIи перспектив его развития.
Во-первых, она позволяет достаточно точно измерять соответствие ИИ-систем предложенному пониманию AGI. Во-вторых, концепция определяет узкие места, а значит – наиболее перспективные направления исследований. В-третьих, ее можно развивать, сохраняя концептуальный подход – практическую измеримость заявленных для AGIтребований.
Подводя итоги, можно сказать следующее.
ИИ, который сможет решать большинство интеллектуальных задач человека, не за горами. Скорее всего, в его основе будет лежать рассуждающая и планирующая LLM, интегрированная с множеством специализированных ИИ-агентов. Называть его AGI– дело вкуса и/или внешней мотивации.
До общего ИИ, который сравнится с человеком по когнитивным способностям, по-прежнему далеко. Пути преодоления критических узких мест – непонятны. Но это не значит, что они не будут найдены.
Резюме. Включаясь в дискуссии об AGIили пытаясь разобраться в теме, нужно для себя решить, какого из двух вышеописанных подходов стоит придерживаться. А самая правильная позиция – четко разделять эти подходы в своей голове и придерживаться нужного в зависимости от контекста дискуссии.
Сюжет 23. Гибридный ИИ и другие пути создания
AGI
Мир реальности
имеет свои пределы;
мир воображения безграничен.
Жан-Жак Руссо
Продолжим разговор об общем ИИ (AGI). Далее в сюжете будем понимать под AGIкомпьютерные системы, которые способны воспроизводить когнитивные способности человека. Это не цифровая экосистема, в которой LLMи интегрированные с ней ИИ-агенты решают большинство практических задач, ранее решавшихся человеком.
С такой экосистемой на концептуальном уровне все более-менее понятно. Она технологически развивает революционные процессы, запущенные в 2022 году. Генеративный ИИ будет все лучше решать все более широкий круг задач. Он несет миру трансформацию практически во всех сферах человеческой жизнедеятельности, многочисленные возможности и не менее многочисленные риски и угрозы.
Об этом мы будем говорить в трех последних частях книги.
Тем не менее любознательное человечество никогда не оставит попытки получить полноценный AGIв самом широком смысле этого термина. Ученые, исследователи и эксперты в области ИИ смотрят на задачу создания общего (в смысле – сильного) ИИ, как на экзистенциональный вызов.
Обычные люди смотрят на происходящее как зрители захватывающего фантастического блокбастера. С полной уверенностью, что все обойдется и ничего плохого с нами не случится. Если честно, мы тоже верим, что человечество способно справиться с вызовами и выйти из всех цивилизационных тупиков. Иначе вряд ли бы взялись за написание серии книг «Цифра на марше».
После этого короткого отступления вернемся к путям создания AGI.
Сразу отметим, что практически закрыт путь эмерджентного получения AGIчерез простое масштабирование LLM. Об этом в первый год революции генеративного ИИ любили говорить некоторые эксперты ИИ-отрасли во главе с лидером OpenAIСэмом Альтманом. Они утверждали, что по мере увеличения числа параметров у LLMпоявятся неожиданные (эмерджентные) способности, которые приблизят генеративный ИИ к полноценному AGI.
О тщетности подобных надежд на масштабирование LLMмы уже писали. Уткнувшись в порог вычислительной сложности, исследователи предложили иную архитектуру – MoE. В ней LLM– не единая нейросеть с сотней миллиардов параметров, а совокупность нейросетей-экспертов, интегрированных в единое комплексное решение. Нейросеть-эксперт – это мини-LLM, отвечающая за решение определенного круга задач. Слово «мини» условно, так как речь все равно идет о десятках миллиардах параметров для каждой нейросети.
Поэтому обратимся к иным подходам к созданию AGI.
Первый подход связан с крупномасштабным моделированием человеческого мозга. Это подход принципиально отличается от похода, который выбрали разработчики LLM, хотя и там и там используются нейросети.
Нейросети в LLMимитируют функции человеческого мозга, а не работу самого мозга. Даже на уровне теоретической модели они принципиально отличаются от нейронной сети мозга.
Разработчики крупномасштабных моделей мозговой активности стараются воспроизвести именно структуру человеческого мозга. В надежде, что на каком-то этапе количественные успехи перейдут в качество – крупномасштабная технологическая модель биологического мозга начнет демонстрировать когнитивные способности.
Одними из первых в 2006 году проблемой занялись исследователи компании IBM. Их целью было детальное моделирование структуры нейронов в неокортексе мозга крыс. Напомним, что неокортекс – это самое позднее эволюционное приобретение высших животных и человека. Этот отдел мозга отвечает за их когнитивные способности.
В коре неокортекса нейроны организованы в элементарные единицы – неокортикальные колонки, имеющие порядка 0,5 мм в диаметре и 2 мм высотой. Каждая такая колонка содержит около 10 000 нейронов со сложной, но упорядоченной структурой. Колонки определенным образом связаны с соседними колонками и внешними по отношению к ним группами нейронов. Предполагается, что когнитивные способности являются следствием работы таких колонок как элементарных нейронных образований.
Исследователям удалось получить модель колонки неокортекса клеточного уровня, построенную исключительно по биологическим данным. Что это значило с практической точки зрения, понятно, наверное, только самим исследователям. Впечатлить общественность такие результаты не могли.
Не смогли впечатлить общественность и остальной научный мир результаты последующих исследований. Их участники утверждали, что развитие темы поможет в создании AGIв достаточно короткий срок (опять пресловутые 25 лет!). Однако вполне обоснованно другие специалисты в области ИИ испытывали скепсис.
Крупномасштабное моделирование мозга направлено на исследование распространения активности в мозге и моделировании мозговых ритмов. В рамках таких проектов практически не уделяется внимание обучению, что сводит на нет полезность наработок в этой области как базы для создания AGI. По крайней мере – пока.







