Цифра и интеллект. 50 сюжетов об искусственном интеллекте
Цифра и интеллект. 50 сюжетов об искусственном интеллекте

Полная версия

Цифра и интеллект. 50 сюжетов об искусственном интеллекте

Язык: Русский
Год издания: 2026
Добавлена:
Настройки чтения
Размер шрифта
Высота строк
Поля
На страницу:
12 из 14

Своего подхода продолжают придерживаться некоторые исследователи старой школы ИИ. Они продолжают верить, что полноценный AGIвозможно создать, используя только символические модели ИИ. Нужно просто наконец коллективными усилиями сформировать и описать в технологических категориях полноценную картину мира и дополнить ее всеми необходимыми аксиомами и правилами вывода.

Сегодня можно утверждать, что такой подход находится в маргинальной зоне ИИ как научного направления. Большинство экспертов, посвятивших свою жизнь символическому ИИ, сегодня являются активными сторонниками третьего, пожалуй, самого перспективного подхода к созданию AGI. В рамках этого подхода предлагается создавать гибридный ИИ, в котором будут органично сочетаться и дополнять друг друга символический ИИ и генеративные нейросети.

Об этом подходе и поговорим.

Первое, что может привнести символический ИИ в будущий AGI, –более-менее полноценную картину мира. Формирование и символьное описание такой картины – сложнейшая задача. Для современных LLMс натяжкой можно говорить о некотором приближении к представлению о том, как устроен окружающий мир. Это представление неполно, построено на вероятностях и потенциально ошибочно.

LLMобучают понимать не окружающий мир, а его языковое выражение в самых разных текстах: от философских трактатов до диалогов в социальных сетях. Это языковое выражение плохо предсказуемо по последствиям его восприятия и усвоения. Никто не знает, какие связи между словами-токенами выстроятся в LLMв результате обучения на огромных текстовых массивах. Эти связи будут случайны, хотя и статистически значимы. Использоваться они тоже будут на основе вероятностных подходов.

Скорее всего, понятие «кот» и признак «черный» окажутся в LLMблизки друг к другу. Как окажутся близки друг к другу понятия «кот» и «животное». Для анализа и генерации текстовой информации этого будет достаточно. А для переноса в долговременную память? Без такой памяти обеспечить непрерывное обучения и создать полноценный AGIне получится.

Что же такое картина мира с точки зрения символьного ИИ?

Картина мира должна быть основана на динамическом графе знаний. Приведем его предельно упрощенное описание, которого, надеемся, будет достаточно, чтобы читатель оценил сложность задачи.

Каждый граф состоит из узлов (вершин), соединённых между собой рёбрами. Нейросеть – это тоже граф, в котором нейроны (узлы графа) соединены между собой связями (ребрами графа).

Весь граф знаний можно условно разбить на огромное множество троек, каждая из которых состоит из двух узлов и соединяющего их ребра (связи). Между узлами «кот» и «черный» связь можно назвать «иметь цвет». Между узлами «кот» и «млекопитающее» связь «входить в объем понятия».

Таким образом каждый узел в графе знаний может быть связан с множеством других узлов разными по смыслу связями. «Кот» и «крыша» – связь-свойство «ходить по». «Кот» и «полосатый» – связь-признак «иметь раскраску». «Кот» и «хозяин» – связь-свойство «любить». «Кот» и «мышь» – связь-свойство «охотиться».

Теперь представьте себе многообразие подобных узлов в окружающем мире и оцените масштаб задачи. Но это еще не все.

Между двумя узлами может быть несколько разных ребер-связей. Узлы «кот» и «вода» имеют два ребра-связи «тонуть» и «плыть». А может и больше, чем два. Например, «мыться». Или еще больше… Теперь представьте, сколько разных связей можно установить между узлами «кот» и «человек».

Связи могут быть разнонаправленными. Связь между узлами «кот» и «молоко» направлена в одну сторону. Связь между узлами «кот» и «мышь» можно рассматривать как двустороннюю: «охотиться» и «убегать».

Наконец, в графе знаний один узел может выступать в двух ролях, то есть связь выходит из узла и в него же заходит. Два кота – это представители одного узла графа знаний. Это могут быть мама-кошка и ее котенок – связь первого вида. Это может быть кошачий альфа-самец, доминирующий над слабым собратом. Или мартовский кот, привлекающий внимание окружающих самок своими воинственными воплями.

Сложность задачи все возрастает, но и это еще не все.

Модель окружающего мира лежит в основе человеческого интеллекта. Именно это понимание заставляет разработчиков искать пути создания ее аналога для ИИ. Но если брать за основу модель мира человека, выясняется еще одно усложняющее задачу обстоятельство.

У каждого конкретного человека в картину мира входят не только обобщенные понятия, но и конкретные объекта. Это не только категория «кот», обобщающая множество реальных котов. У конкретного человека в граф знаний включены узлы для десятка реальных котов, с которыми он сталкивался по жизни. Васька – черный и злобный, Мурка – пятнистая, ласковая и пугливая, … Это все новые узлы и ребра и так уже в огромном, почти бесконечном графе знаний.

Теперь вспомним, что наш граф знаний – динамический. А это значит, что некоторые связи между узлами имеют непостоянный характер. Они то возникают, то исчезают, то меняются. Кот залез в воду помыться, но его унесло течением. Была одна связь «мыться», стала другая – «плыть».

Как же со всем этим справляется человеческий мозг? Неужели у нас в нейронной сети мозга заложено столько связей, которые в нужный момент просто активируются? Скорее всего, наш мозг не хранит подобные связи, а при необходимости способен их генерировать. Любой мало-мальски творческий человек может для пары «кот» и «крыша» придумать несколько возможных связей. Как мы это делаем, если раньше об этом никогда не задумывались? Как и многие вопросы про работу человеческого мозга, этот пока остается без ответа.

Из вышесказанного вытекает два подхода к формированию картины мира для будущего AGI. Первый – детально описать окружающий мир хотя бы на уровне категорий и обобщенных понятий, без конкретных Мурок, Шариков, Иван Петровичей, ООО «Рога и копыта». Второй – научить ИИ учиться так же, как учится ребенок с постепенным формированием картины мира, в которой найдется место коту Ваське, соседскому попугаю, папиной работе и маминому любимому платью.

Возможно, правильный путь – это сочетание двух указанных подходов. Какая-то базовая предустановленная картина мира, интегрированная с механизмами ее пополнения. Ведь в любом случае, без постоянного обновления картины мира нельзя говорить о непрерывном обучении, которое свойственно человеческому мозгу.

Второй вопрос – как превратить цифровую картину мира в долговременную память ИИ, из которой он при необходимости сможет оперативно и без существенных вычислительных затрат извлекать нужные узлы и связи между ними.

Третий (далеко не последний) вопрос – как добавить ИИ способность к целеполаганию, прогнозированию, сознательному самообучению, эмоциональный интеллект? Вопросов много, но уже очевидно, что именно с интеграцией символьного и генеративного ИИ стоит связывать надежды на прорывы в создании полноценного AGI.

Генеральный директор MicrosoftСатья Надела назвал AGI«крупнейшим технологическим прорывом человечества со времен промышленной революции». Одновременно он предупредил, что разработка общего ИИ должна быть в первую очередь направлена на повышение человеческого интеллекта, а не на его замену.

Полностью присоединимся к этому тезису.

Резюме. Создание полноценного AGI– сложная и пока плохо предсказуемая по срокам реализации задача. На пути ее решения исследователей ждет много вызовов. Преодоление этих вызовов несомненно усилит практические возможности современных технологий ИИ.


Сюжет 24. Основные подходы к тестированию ИИ

Я не провалил тест,

я просто нашел 100 способов

сделать его неправильно.

Бенджамин Франклин

ТестированиеИИможноразделитьнадванаправленияпоцели,скоторойонопроводится.Во-первых,этопроверкаконкретнойИИ-системынаработоспособность.Во-вторых,этопроверкаИИнаблизостькAGI.Этопринципиальноразныецели,которыепредполагаютпринципиальноразныеподходыкорганизациитестированияиподобрутестовыхматериалов.

НачнемспервоготестированияработоспособностиИИ-систем.

ТаккакИИ-системыэтовпервуюочередьпрограммноеобеспечение,длятестированияихработоспособностиприменяетсяопыт,накопленныйзадесятилетияцифровойэры, итрадиционныевидытестирования.

Функциональное тестирование,входекоторогопроверяется,чтоИИ-системаведётсебявсоответствиистребованиямииспецификациями.Какправило,онопроводитсявнесколькостадий.НапервойпроверяетсязаявленныйфункционалвсехкомпонентовИИ-системыпоотдельности.Навторойихинтеграциямеждусобой.НатретьейработоспособностьИИ-системыкакединогопрограммногокомплекса.

Тестирование производительности,входекоторогопроверяется,какИИ-системасправляетсясплановыми,стрессовымиипиковыминагрузками.Плановыенагрузкиэтообычныйтрафикзапросоввсоответствиисосценариямииспользования.Стрессовыенагрузкипредполагаютпостепенноеувеличениеколичествазапросовдозначений,когдаИИ-системаперестаетнанихоткликаться.ПиковыенагрузкиэтопроверкаустойчивостиИИ-системывслучаерезкогоростаколичествазапросов.

Тестирование на безопасность– выявление уязвимостей, которые могут быть использованы злоумышленниками. Оно включает проверку проблем с аутентификацией, шифрованием данных, вредоносными инъекциями и другими уязвимостями.

Все это классика тестирования ПО, которая применяется при разработке любых ИИ-систем. Однако функциональное тестирование современных ИИ-систем, в основе которых лежат LLM, кардинально отличается от функционального тестирования традиционного ПО. Основная причина – недетерминированность результатов тестирования.

В традиционных приложениях один и тот же тестовый пример всегда должен давать один и тот же результат. ИИ-системы могут возвращать различные результаты в одинаковых тестовых примерах, и все результаты могут быть корректными. Поэтому в чистом виде традиционные подходы тестирования для ИИ-систем не работают и требуют существенной модернизации.

Перечислим три основные проблемы тестирования ИИ-систем.

Недетерминированность результатов, которая порождает сложность выявления правильных откликов. В качестве решения проблемы предлагается использовать статистические подходы к оценке откликов, использование доверительных интервалов, в которые должны попадать правильные результаты.

Эволюционирующее поведениеИИ-систем, которые периодически дообучаются на новых данных, что может приводить к изменению их поведения. В качестве решения предлагается постоянное обновление тестовых данных, при формировании которых должно учитываться дополнительное обучение ИИ-системы.

Чувствительность к данным, которая приводит к непредсказуемым результатам в нестандартных тестовых примерах. В качестве решения предлагается особое внимание уделять тестированию при граничных условиях, а также специальное автоматическое тестирование «мусорными» данными.


При тестировании ИИ-систем особое внимание уделяют:

подготовке тестовых данных (с учетом описанных выше проблем и возможности их автоматической генерации);

автоматизации тестирования (так как тестирование ИИ-систем требует существенного увеличения количества тестовых примеров);

A/B тестированию, при котором сравнивается эффективность выполнения двух разных тестовых примеров.

LLM– ядро практически любой современной ИИ-системы. Поэтому отметим несколько важных аспектов проверки ее работоспособности, выходящие за рамки традиционных представлений о тестировании.

В наборы данных для тестирования не рекомендуется включать данные, которые использовались для обучения LLM. Это приводит к заведомо завышенным результатам, которые потом могут не подтвердиться в условиях реального использования.

Особое внимание при тестировании LLMнужно обращать:

на точность результатов, так как правильные или примерно правильные ответы могут лежать в очень широких диапазонах;

на обобщающие способности LLM, которые позволяют правильно отвечать на запросы, включающие новые для нее данные;

на скорость выполнения запросов, в том числе в зависимости от количества информации, помещенной в контекстное окно;

на стабильность выполнения запросов в случае, если входные данные не меняются или меняются не существенно;

на реакцию LLMна злонамеренные инъекции данных – включение в контекст запроса заведомо ложных, не этичных, оскорбительных данных или иных информационных манипуляций;

на этичность ответов LLM, которая предполагает проверку их соответствия принятым в обществе нормам отношения к различным ценностям, традициям, официально установленным законам;

на интерпретируемость ответов LLM, которая предполагает возможность объяснить, как и почему модель выдала именно такой ответ.

На этом завершим обзор подходов к проверке работоспособности ИИ-систем. Это понятное направление, которое развивается на стыке традиционных подходов к тестированию, QA-инженерии и машинного обучения. Сочетание таких компетенций – это вызов для системы подготовки и переподготовки ИТ-специалистов, особенно с учетом роста ИИ-систем (по некоторым оценкам ИИ включен сегодня в 40% программных продуктов). Однако это – другая история.

Второе направление – проверка ИИ на соответствии требованиям, которые предъявляются к AGI. И здесь сразу же возникает проблема, которую мы описали ранее. В экспертном ИИ-сообществе нет общего представления, что такое AGIи каким требованиям он должен удовлетворять. Поэтому для дальнейшего понимания сразу определимся с трактовками. Под AGIбудем понимать ИИ, который способен демонстрировать когнитивные способности, присущие человеку.

Существует несколько подходов к проверке на близость к такому пониманию AGI. Кратко опишем те, которые считают основными.

Первый подход – тесты в стиле теста Тьюринга. Некоторые носят явно шуточный характер. Вот несколько таких тестов:

тест студента: AGIдолжен поступить в университет, освоить все курсы и защитить диплом (предложен Беном Герцелем);

тест трудоустройства: AGIдолжен самостоятельно устроиться на работу и выполнять на ней все должностные инструкции;

тест IKEA: AGIдолжен правильно собирать мебель из магазина IKEA на основе прилагаемых инструкций;

кофейный тест: AGIдолжен приготовить и подать кофе, оказавшись на незнакомой кухне (предложен Стивом Возняком);

тест миллиардера: AGIдолжен заработать 100 миллиардов долларов (предложен Сэмом Альтманом, поддержан Microsoft).

К этим тестам как нельзя лучше подходит русская поговорка «в каждой шутке есть доля правды». Вряд ли их авторы просто шутили – они скорее придумывали задачи, требующие сложной интеллектуальной деятельности. Думаем, наш читатель способен сам придумать подобный тест, и не один.

Второй подход – проверять ИИ на способность решать круг сложных специфических интеллектуальных задач, с которыми сталкиваются люди, в том числе те, кого относят к интеллектуальной элите.

Это самый распространенный подход – сегодня такие комплекты проверочных заданий (бенчмарки, от англ. benchmark – эталон, критерий) создают разные организации.

В рамках этого подхода LLMдолжны решать экзаменационные тесты, выполнять олимпиадные задания по разным предметам, проходить профессиональные квалификационные испытания, решать типовые задачи конкретной предметной области.

Это популярные виды проверки, которые к тому же задают направления, в которых можно улучшать работу генеративного ИИ. По ним постоянно проводят соревнования между LLMлидеров рынка, между ИИ и лучшими специалистами-людьми.

Так в 2025 году ИИ-модель от OpenAIнеформально заняла первое место на Международном студенческом командном чемпионате по программированию, решив 12 задач из 12 возможных.

OpenAIиспользовала три модели: ChatGPT-5, экспериментальную рассуждающую модель и отдельную модель для выбора финального решения из набора из предложенных вариантов. Ни одна из них не обучалась специально для этих соревнований.

ChatGPT-5 решил 11 задач, а последнюю самую сложную задачу решила экспериментальная модель. Этот же набор моделей затем победил на студенческой олимпиаде по математике, что подчеркивает универсальность моделей и подхода.

Результаты впечатляют. Но одновременно они говорят о том, что данный подход не очень соответствует пониманию AGIв заявленном выше смысле. Скорее он подходит к оценке ИИ на способность решать реальные задачи, с которыми сталкиваются люди в практической деятельности (напомним, это более узкое понимание общего ИИ).

Третий подход – это проверка ИИ на способность решать специально сформированные тесты, которыми проверяют разные аспекты когнитивной деятельности человека. Об этом подходе, предложенном экспертной группой из ведущих западных университетов и центров, мы уже писали в сюжете про понимание, что такое AGI.

Здесь только отметим несколько существенных, на наш взгляд, моментов. Во-первых, за столетие человечеством накоплено огромное количество тестов на проверку когнитивных способностей людей. Нужно только отбирать наиболее подходящие. Во-вторых, многие тесты требуют адаптации для их предъявления ИИ. Они, как правило, предполагают комплексное восприятие текстовой и визуальной информации, и с ними пока плохо справляются даже мультимодальные LLM. В-третьих, нужно расширять спектр проверяемых когнитивных способностей, предложенных сообществом экспертов. И в первую очередь – в вопросах, связанных с обучением на ограниченных данных.

Четвертый подход предложен коллективом под руководством Франсуа Шолле, который долгое время работал в Googleведущим специалистом по ИИ. Этот подход как раз и предполагает проверку способности ИИ моментально учиться на ограниченных данных. При этом проверочные задания подбираются таким образом, чтобы хорошие результаты мог продемонстрировать обычный человек.

Первая версия комплексного теста, в которую вошло около 1000 заданий, была предложена Шолле в 2019 году. Сначала тест назывался «Корпус абстракций и рассуждений», потом был переименован в ARC-AGI-1. В тест вошли разнообразные задания, аналоги некоторых можно видеть в тестах на проверку IQ(коэффициента интеллекта человека).

Во многих заданиях теста ARC-AGI-1, две части. В первой части есть исходное изображение и изображение, которое получается из исходного после применения некоторых правил преобразования (например, по этим правилам меняются цвета и местоположение элементов изображения). Во второй части есть другое исходное изображение, к которому нужно применить те же правила преобразования. Люди с нормальным IQ практически сразу определяют правила преобразований и легко решают подобные задачи.

Тест ARC-AGI-1не поддавался LLMвплоть до 2024 года. Лучшие модели показывали на нем результаты, значительно уступающие результатам обычных людей, решая менее трети заданий. Только к концу 2024 года лидеры ИИ-рынка стали показывать на этом тесте результаты, сравнимые с результатами людей.

В 2025 году коллектив Франсуа Шолле предложил новую версию теста, которая получила название ARC-AGI-2. Концепция подбора заданий сохранилась. Они стали более сложными (для ИИ), но даже более простыми для обычных людей. По мнению разработчиков теста человек с IQнемногим выше среднего выполняет тест на 100%.

В течении 2025 года флагманские LLMведущих игроков демонстрировали слабые результаты в решении заданий нового теста. Ни одна модель не могла преодолеть барьер в 50% выполненных заданий. И только в конце года молодая компания выходцев из DeepMindпоказала решение, которое выполнило 54% заданий теста. Интересно, что компания не имела собственной LLM, а ее решение занималось согласованием работы нескольких LLM-лидеров (Gemini 3, ChatGPT-5.1, Grok 4 Fastи других).

Четвертый подход как проверка на близость к AGIбезусловно интересен, но все-таки представляется несколько ограниченным. По сути, тесты ARC-AGIпроверяют способность LLMрешать головоломки, с которыми относительно легко справляются люди. Скорее всего, в 2026 году ведущие модели успешно пройдут тест ARC-AGI-2, и команде Шолле придется разрабатывать новую версию.

Резюме. Проверка работоспособности современных ИИ-систем требует существенной модернизации традиционных подходов к тестированию ПО. Проверка ИИ на близость к AGIтребует дальнейших исследований, которые позволят получать объективные результаты. Такие результаты нельзя получать только за счет специальной адаптации LLMк конкретным тестовым комплектам.

Сюжет 25. Эмерджентные способности

LLM

– не ждали!?

Жизнь оптимистов

полна неожиданностей.

Константин Мелихан

Этот сюжет начнем с определений.

Система– это сущность, которая в результате взаимодействия ее частей может поддерживать свое существование и функционировать как единое целое.

Важно понимать, что система больше, чем просто набор составляющих ее элементов. Если мы разберем автомобиль на запчасти и сложим их на дороге, этот набор никуда не поедет. Поэтому в теории систем появился термин эмерджентность– явление, при котором в сложной системе проявляются характеристики или поведение, которые не свойственны отдельным ее компонентам.

Таким образом в теории систем эмерджентное свойствосистемы – это свойство, которым обладает система как целое, но не обладают ее компоненты. Эмерджентные свойства могут быть запланированными, ожидаемыми или неожиданными.

Запланированные эмерджентные свойства демонстрирует вся сложная техника, созданная человеком. Техническая система автомобиль, которая состоит из десятков тысяч деталей, имеет запланированные эмерджентные свойства: двигаться, перевозить пассажиров и грузы. Хотя подобные эмерджентные свойства продемонстрировала даже первая телега, придуманная в далеком прошлом.

Эмерджентные свойства могут возникать спонтанно в результате усложнения системы – увеличения числа ее компонентов и связей между ними. Некоторые из них вполне ожидаемы. Классический пример – упорядоченная жизнь муравейника. Другой пример – поведение больших скоплений людей в экстремальных ситуациях, тоже вполне предсказуемое.

Классический пример неожиданных эмерджентных свойств – интеллектуальное поведение живых организмов по мере усложнения нервной системы. Нервная система червяка – 300 нейронов. Нервная система человека – десятки миллиардов нейронов и триллионы связей между ними. Описать все, на что способен человеческий разум, психологи не могут до сих пор. Все наши когнитивные способности – это эмерджентные способности сложнейшей нервной системы.

На страницу:
12 из 14