
Полная версия
Цифра и интеллект. 50 сюжетов об искусственном интеллекте
Самообучаемость. Программные агенты должны учиться на своих ошибках. Ошибок должно становиться все меньше и меньше, точность предвидения и качество помощи возрастать. Для этого между программным агентом и владельцем должна быть налажена обратная связь. Результаты обратной связи программный агент должен хранить и анализировать.
Да, эти требования были сформулированы около 50 лет назад. Однако достаточно быстро стала очевидной невозможность их реализовать на том уровне развития цифровых технологий.
Работу одних программных агентов обеспечивали структурированная база знаний и логический аппарат, позволяющий делать выводы и принимать решения. Главный недостаток подобных программных агентов – высокая сложность проектирования и принципиальная ограниченность в понимании и обработке естественного языка.
В основу других программных агентов были положены поведенческие модели, которые предполагали реакцию на события внешнего мира. В отдельных случаях такой подход давал неплохой результат. Об успехах и пользе поисковых роботов уже упоминалось. Но в целом такие программные агенты были слишком ограниченными, имели минимальный уровень адаптивности и предвидения.
Нейросети в те времена были баловством без серьезного функционала. Серьезно в качестве основы для программных агентов они никем не рассматривались.
Поэтому после появления персональных компьютеров эйфория быстро прошла. Тема программных агентов на 40 с лишним лет отодвинулась на задворки индустрии разработки ПО. Энтузиасты продолжали эксперименты, результаты которых никого не интересовали.
Все изменилось с появлением чат-бота ChatGPT3.5. Его феноменальный успех, многочисленные новые модели генеративного ИИ, выходящие на рынок буквально каждую неделю, интеграционные механизмы, о которых мы рассказывали в прошлом сюжете. Все это не просто вернуло в повестку тему интеллектуальных автоматических помощников человека – тема стала доминировать в публикациях и прогнозах. Только термин программные агентыпостепенно забылся, а в обиход вошел новый термин: ИИ-агенты.
Идея была проста и очевидна. Платформы AIWorkflowпоказали свою эффективность в автоматизации многих рабочих процессов. Осталось сделать небольшой шаг – устранить из оркестра инструментов дирижера-человека и поставить вместо него ИИ-агента. Человеку же оставалось наслаждаться плодами настоящей автоматизации, о которой недавно нельзя было даже мечтать.
ИИ-агент – это автономная ИИ-модель, которая предназначена для решения распределенных во времени многошаговых сложных задач, поставленных перед ней пользователем. В процессе их решения ИИ-агент самостоятельно взаимодействует с окружающей средой, обрабатывает полученные данные, согласовывает их с поставленной задачей и принимает управленческие решения по использованию тех или иных интегрированных с ним инструментов.
ИИ-агент – по определению относится к категории мультимодальных моделей, так как взаимодействие с окружающим миром предполагает восприятие и обработку различных типов данных.
ИИ-агент – это следующий за AIWorkflowшаг на пути автоматизации деловых процессов. Теперь не человек составляет планы, в соответствии с которыми запускаются те или иные инструменты и решаются задачи. Человек ставит общую задачу и с нетерпением ждет, когда ИИ-агент обеспечит ее решение.
Запуск инструментов AIWorkflowоснован на предопределенных триггерах и конкретных расписаниях. ИИ-агенты используютLLMдля обработки сложных данных, понимания контекста и реагирования на непредсказуемые сценарии.
Хочу на неделю в Испанию!ИИ-агент, получив задачу, изучает предложения турфирм. Он знает предпочтения человека (например, тот мечтал о поездке в любимой социальной сети). На основе этого знания ИИ-агент составляет программу пребывания. Из календаря узнает даты отпуска, покупает билеты на самолет, бронирует гостиницу, заказывает экскурсии, столики в ресторанах. Когда все сделано, докладывает человеку, что недельный отпуск в Испании готов.
Красивая сказка, которая технически вполне реализуема. Только какой процент людей готов делегировать своему ИИ-агенту приобретение билетов, предоплату экскурсий? Рискнем предположить, что подавляющее большинство опытных ИИ-пользователей предпочтут разбить решение задачи «отпуск в Испании» на этапы и на каждом этапе отдельно подключать ИИ, лично контролируя важные шаги.
Вот еще одна сказка из одной публикации. Человек спрашивает обычный чат-бот, как приготовить омлет. В ответ получает самые популярные рецепты. Человек, живущий в умном доме, говорит своему ИИ-агенту: «Хочу на завтрак омлет!» ИИ-агент находит рецепт, проверяет наличие продуктов в умном холодильнике. Если все ингредиенты в наличии, отправляет команду на умную плиту, чтобы она разогрелась до нужной температуры. Одновременно диктует человеку инструкцию, какие продукты брать и что с ними делать. То есть, яйца все равно придется человеку разбивать и взбивать самому.
В большинстве сложных распределенных задач есть этапы решения, которые требуют повышенной надежности. Слишком высоки риски неудачных или ошибочных решений. Покупка не тех билетов. Приглашение на встречу не того человека. Отправка не до конца готового отчета. Выплата незаслуженной премии. Увольнение ценного сотрудника… Список рисков можно продолжать.
В начале 2025 год исследователи из Carnegie Mellon Universityпровели эксперимент. Была создана виртуальная вымышленная компания по разработке ПО, в которой работали ИИ-агенты лидеров отрасли – Google, OpenAI, Anthropic. Они выполняли роли финансовых аналитиков, инженеров-программистов, менеджеров проектов, работников отдела кадров. Исследователи ставили перед ними задачи, основанные на повседневной работе реальной компании-разработчика ПО.
Результаты оказались плачевными. Лучшие результаты показали ИИ-агенты компании Anthropic, которые выполнили 24% поставленных задач. ИИ-агенты остальных компаний показали еще более слабые результаты. В отчете исследователи написали, что агенты страдают от недостатка здравого смысла, слабых социальных навыков и плохого понимания того, как пользоваться интернетом.
Но уже в начале 2026 года все больше компаний заявляют о том, что они смогли создать экосистемы ИИ-агентов, которые способны решать комплексные долгосрочные задачи без участия человека или с минимальным его участием. В таких экосистемах, как правило, одна модель выступает координатором, который делит сложную задачу на шаги, для каждого шага подбирает подходящего ИИ-исполнителя, согласовывает и проверяет промежуточные результаты.
Наверное, пока преждевременно говорить о том, что все белые воротнички в скором времени уступят свои рабочие места ИИ-агентам. Скорее следует ожидать, что сильные специалисты, вооруженные самыми разными ИИ-инструментами, будут доминировать на рынке труда. Уходить придется тем, кто привык, не напрягаясь, выполнять свою рутинную работу «от сих до сих».
ИИ-агенты и мультиагентные экосистемы – это реальный прорыв в автоматизации деловых процессов. Пока еще далеко до универсального решения, способного во всех вопросах заменить человека-помощника. Но специализированные ИИ-агенты, эффективно решающие достаточно сложные, но конкретные задачи, – это реальность. Наверное, свою нишу найдут ИИ-агенты, помогающие помощникам руководителей быть предельно эффективными.
Резюме. Об ИИ-агентах можно сказать то же самое, что в целом говорится о генеративном ИИ. Их развитию и признанию мешают чрезмерный хайп и завышенные ожидания. Когда пена уляжется, мы увидим, как ИИ-агенты в действительности изменили мир.
Сюжет 18. Взаимодействие
LLM
с внешней средой
Сила команды — в каждом участнике.
Сила каждого участника — в команде.
Фил Джексон
ИИ-агенты – перспективная архитектура построения сложных программных систем, в которыхLLMиграет роль координатора выполнения задач. Координатор определяет, какое внешнее приложение, в какой момент и с какими параметрами нужно запустить. Он же должен принять и оценить результаты работы внешней системы.
И здесь разработчики ИИ-агентов сталкиваются с серьезной проблемой. Многие информационные системы открыты к взаимодействию с другими системами и для этого используют специальный программный интерфейс (Application Programming Interface, API).
Для разработки APIиспользуются форматы и протоколы, которые понятны и детально описаны. Каждая информационная система предлагает свой собственный API, который позволяет с ней взаимодействовать. К каждому такому APIразработчики ИИ-агентов должны писать отдельный программный код. Чем с большим числом внешних систем должна взаимодействоватьLLM, тем большее число APIнужно учитывать и больше программного кода для организации взаимодействия нужно писать и сопровождать.
Разработчик ПО – одна из тех профессий, где цениться лень (в хорошем смысле этого слова). Программисты стараются любую задачу, которая более-менее повторяется, стандартизировать и впоследствии решать быстро и не сильно напрягаясь. Так в свое время появились стандарты для разработки API, которые существенно упростили взаимодействие программных продуктов разных разработчиков.
Понятно, что разработчикиLLMстремились организовать взаимодействие своих моделей с максимальным числом внешних систем. Понятно, что это в итоге побудило пытливый программистский разум к поиску путей стандартизации такого взаимодействия.
В конце 2024 года ИТ-сообществу был предложен открытый протокол контекста модели(Model Context Protocol, MCP). MCPпредлагался для «стандартизации интеграции ИИ-моделей в приложения и экосистемы, предоставления унифицированного способа обмена контекстом между моделью, клиентом и сервером». Другими словами, чтобы LLMавтономно взаимодействовала с внешними системами и при этом учитывала текущий контекст.
В статье на Википедии авторами MCPназвана «группа разработчиков из сообщества open source». В других публикациях авторство разработки MCPпринадлежит одному из ИИ-лидеров – компании Anthropic. Правда, компания сразу же провозгласила MCPоткрытым протоколом, опубликовала его в полном объеме и предложила ИТ-сообществу развивать протокол коллективными усилиями как opensource.
MCPсчитается ключевой инновацией на стремительно развивающемся рынке ИИ-агентов, появившейся очень вовремя. Протокол поддержали ведущие игроки рынка – OpenAI, Google, Microsoft, Amazon. Прошло несколько месяцев с момента опубликования протокола, и его поддержка появилась в большинстве моделей, генерирующих программный код. Сотни компаний заявили о практических разработках с применением MCP.
То, что инициаторами нововведения выступили разработчики Anthropic, не удивительно. Модель компании Claude Sonnetв гонкеLLMпоказывает лучшие результаты именно в генерации программного кода и пользуется большой популярностью у разработчиков.
Еще раз зафиксируем назначение и главную фишку MCP. ПодключениеLLMк внешним приложениям-инструментам через APIтребует индивидуальной интеграции для каждой пары «LLM– приложение». Это приводит к фрагментации и дублированию усилий, затрудняет масштабирование ИИ-агентов. MCPпредоставляет универсальный протокол – разработчики внедряют MCPодин раз в своюLLM, и это открывает доступ к целой экосистеме интеграций.
Когда мы говорим «подключение к приложениям» имеется в виду:
подключение к программным инструментам, которые выполняют по запросуLLMконкретные задачи (например, математические вычисления);
подключение к источникам данных, из которых по запросуLLMизвлекается нужная информация (например, текущие курсы валют или актуальный прогноз погоды).
Таким образом с помощью MCP:
унифицируется взаимодействие между различными моделями ИИ и внешними системами и источниками данных;
сокращаются повторяющиеся разработки и повышается их качество за счет стандартизации;
упрощается подключение новых инструментов и источников данных кLLM, что делает разработку ИИ-приложений более доступной;
расширяются возможности ИИ-агентов за счет более доступной интеграции с внешними системами и источниками данных.
MCPменяет концепцию: вместо создания ИИ-агента с фиксированным набором подключенных инструментов предлагается создание ИИ-экосистем. Ядром ИИ-экосистемы являетсяLLM, которая поддерживает MCP. РазработчикиLLMвыделяют специальный MCP-сервер, на котором по стандартам описываются механизмы взаимодействия сLLM. Через этот MCP-сервер кLLMможет подключаться неограниченное количество внешних систем и источников данных.
MCPупрощает не только работу разработчиковLLM.
Предположим, компания имеет собственные источники данных и хочет использовать готовое ИИ-приложение из имеющихся на рынке. Как ей подключить свои источники данных к этому ИИ-приложению?
MCPпозволяет решить эту задачу. Компания выделяет специальный MCP-сервер и описывает на нем свои источники данных и доступ к ним в соответствии со стандартами MCP. Затем на MCP-сервере стороннего ИИ-приложения в конфигурационных настройках указывает доступ к своему MCP-серверу. После этого ИИ-приложение получает доступ к источникам данных компании и дальше работает с их учетом.
Ключевой принцип MCP– отделение логики и кода ИИ-приложения от логики и кода интеграции с внешними системами и источниками данных. Это фундаментальная особенность, которая упрощает:
архитектуру и поддержку ИИ-приложения;
архитектуру и поддержку различных интеграций с внешними системами и источниками данных, изолируя их друг от друга.
Возникает вопрос – насколько сложно разработчикам использовать MCPдля решения своих задач? На самом деле это типовая и относительно несложная задача, которая мало чем отличается от разработки привычного всем API. Тем более есть готовые реализации на Pythonи ряде других языков программирования.
С помощью MCPможно подключаться к любым внешним системам, с которыми можно обмениваться данными или у которых можно вызывать для исполнения какие-либо функции. Это могут быть:
файловая система и различные файловые хранилища;
базы данных, вики-ресурсы, поисковые системы, RAG-системы;
таск-трекеры, электронная почта, системы обмена сообщениями;
социальные сети, мессенджеры, цифровые платформы;
функциональны приложения на локальных компьютерах, физических и виртуальных серверах, в контейнерах;
компьютерные устройства интернета вещей и интернета людей.
Словом, все, что имеет интерфейс, с которым можно взаимодействовать с помощью программного кода.
Что интересно,LLMс помощью MCPможет получить доступ даже к закрытым информационным системам и источникам данных, которые не видны в интернете.
Еще одно важное преимущество MCP– возможность выполнять контекстно-адаптивную загрузку данных. При традиционном подходеLLMзагружает фиксированный, заранее подготовленный набор данных или полный набор данных, который затем фильтрует. При помощи MCPможно динамически определять, какие именно данные нужны в текущем контексте, и запрашивать именно их. Это расширяет возможности по добавлению необходимых дополнительных данных и снижает нагрузку на вычислительные ресурсыLLM.
Приведем примеры применения MCP.
Аналитическое ИИ-приложение получает доступ к различным базам данных (SQLили NoSQL), что дает возможность выполнять сложные запросы и анализировать данные напрямую без посредников.
ИИ-агенты (чат-боты) создают персонализированные коммуникации с клиентами, готовыми приобретать новые товары и услуг. Для этого извлекаются персональные данные клиента из CRM-системы. В совокупности с данными из специальных баз знаний это позволяет формировать релевантные предложения, проводить более эффективные маркетинговые кампании.
Медицинское ИИ-приложение может связывать симптомы пациента, полученные в ходе собеседования, сведения из цифровой медицинской карты и данные с носимых пациентов датчиков, получаемые в реальном времени во время консультации. Это позволяет врачам получать полную картину состояния пациента и принимать более обоснованные решения.
Голосовые системы взаимодействия с клиентами посредством MCPиспользуют различные голоса, которые генерируют сторонние специализированные ИИ-приложения. Это обеспечивает более естественное взаимодействие с клиентами.
Управляющее ИИ-приложение взаимодействует посредством MCPс физическими устройствами. Это упрощает создание умных домов, промышленных систем автоматизации и других решений в сфере интернета вещей.
MCPимеет хорошие перспективы применения в построении корпоративных цифровых экосистем. В таких экосистемах принципиальным является согласованное использование всех внутренних корпоративных данных и средств автоматизации всех деловых процессов. MCPпозволяет решать подобные задачи без переписывания (замены) всего программного обеспечения в рамках комплексной автоматизации. Это гораздо более быстрый и мене затратный способ, чем переход, например, на ERP– единую систему планирования ресурсов предприятия.
MCP– технология молодая, и у нее есть проблемы и недостатки.
В интернете можно найти много MCP-серверов, разработанных самыми разными компаниями. Напомним, что это программные продукты, а не физические компьютерные устройства. Проблема заключается в том, что пока (на конец 2025 года) нет единого реестра MCP-серверов, который помогал бы в объективном выборе нужного решения. Поэтому сегодня иногда проще написать свой MCP-сервер, чем скачивать, изучать и дорабатывать чужие. Хорошая новость в том, что о желании такой реестр создать разговоры ведутся.
Вторая проблема связана с тем, что не все компании, которые используют MCP, готовы поддерживать все возможности этого протокола. При интеграции это приходится учитывать. Иначе будут происходить накладки при попытках установить взаимодействие, которое не поддерживается контрагентом.
Как нам кажется, эти две проблемы в ближайшее время будут решены, так как относятся не к принципиальным технологическим ограничениям, а к болезням роста новой технологии.
Следующие проблемы носят принципиальный характер и пока непонятно, насколько они могут помешать распространению MCP.
ИИ-приложения загружают описания подключаемых инструментов в контекстное окно текущего запроса. Если в одном запросе предполагается обрабатывать много подключений, то контекстное окно перегружается, работаLLMиз-за этого может замедляться.
При решении сложных задач ИИ-приложения как правило разбивают их на этапы. Одни и те же данные, которые используются для промежуточных действий, могут загружаться в контекстное окно в процессе решения задачи по несколько раз. Если эти данные велики по объему, то это способно существенно замедлить работуLLM.
У этих двух проблем есть еще одно печальное следствие. Любые данные в контекстном окне – это токены, которые, как правило, стоят денег. Чрезмерно перегруженные избыточными даннымиLLMведут к дополнительным расходам пользователей. Это та же самая проблема, которая возникает при переходе от обычных к рассуждающимLLM.
Резюме. Протокол MCP– перспективное архитектурное решение. Оно позволяет говорить об интеграции в огромные массивы наработанного за долгие годы программного обеспечения нового слоя – ИИ-приложений. Такие приложения способны автономно взаимодействовать с внешними системами и источниками данных, учитывая контексты пользователей.
Сюжет 19. Персональные данные вчера, сегодня, завтраБудь таким,
каким хочешь казаться.
Сократ
В этом сюжете рассмотрим общую ситуацию с персональными данными в мире генеративного ИИ, а также две концепции, имеющие отношение к этой теме. Первая – концепция Web3.0, которая в том числе предлагает свои подходы к хранению персональных данных. Вторая – концепция децентрализованной идентификации, которую предложил консорциум всемирной паутины W3C.
Начнем с оценки ситуации, которая нам досталась в наследство от пятой информационной революции – революции интернет-технологий. Именно тогда наши персональные данные начали «расползаться» по всемирной паутине. И сегодня мало людей, ведущих более-менее активную жизнь в интернете, в состоянии точно представить, где и какие данные о них хранятся в глубинах Web2.0.
Для справки напомним классификацию этапов развития всемирной паутины. Web1.0– первый этап, когда интернет представлял из себя в основном хранилище информационных сайтов, доступных всем желающим. Персональных данных на этом этапе в интернете было совсем не много. Web2.0– второй этап, который принято отсчитывать с момента появления первых социальных сетей. На этом этапе мы находимся сейчас. Визионеры предлагают переход к Web3.0– этапу децентрализованного интернета, о концепции которого речь впереди.
Социальные сети стремительно распространились по миру, и сегодня в них так или иначе присутствует большая часть жителей нашей планеты. За ними появились многочисленные ресурсы с цифровым контентом, торговые онлайн-площадки, цифровые платформы на все случаи жизни. Их пользователями стали миллиарды людей. И практически все ресурсы предлагали человеку зарегистрироваться и ввести свои данные, включая электронную почту или сотовый телефон.
Таким образом Web2.0стал огромным хранилищем персональных данных жителей Земли – пользователей интернета. Пользователи об этом догадываются, но масштаб вряд ли представляют. Пользователи эти данные считают своими, но в реальности это совсем не так. Пользователи разрешают эти данные использовать, но часто об этом даже не догадываются.
Информацию о пользователях собирают и хранят практически все, кто вывел свой бизнес в интернет-пространство. В первую очередь владельцы поисковых систем, социальных сетей, коллекций цифровых ресурсов, маркетплейсов, цифровых платформ.
При желании о человек можно узнать многое. Что он искал в интернете и какие ресурсы посещал. Что рассказывал друзьям о себе, семье и работе. Что снимал на фото и видео. Что и где покупал, куда летал, где останавливался. Куда ездил на такси, к каким врачам записывался, какие онлайн-курсы изучал. На какие новостные каналы подписался, что комментировал и обсуждал, что хвалил, а что – критиковал.
Это далеко не полный перечень того, что о нас хранит интернет.
С 2022 года к этим бескрайним коллекциям персональных данных присоединились наши диалоги с LLM. Многие уверены, что после сеанса чат-бот забывает о нас и следующую сессию начинает с нуля. Второе верно – если чат-бот не просить специально, он делает вид, что с нами не знаком. Вот только наши диалоги остаются на серверах владельца. Они используются для дальнейшего обученияLLM. Может быть, и для других целей – мы не знаем и можем только догадываться.
Например, чтобы полностью удалить диалоги зарегистрированного пользователя с ChatGPT, нужно удалить его учетную запись. По крайней мере, так уверяет своих пользователей OpenAI.
Сохраняет прошлые беседы и флагманскаяLLMкорпорации Google– Gemini. Пользователям предоставляется право управлять историей общения, удалять из нее диалоги. Но, возможно, здесь та же ситуация, что и с историей посещения сайтов в браузере Chrome. Googleоставляет за собой право хранить отдельные факты посещений сайтов пользователем «для улучшения услуг». Такие данные будут храниться в течении всего срока действия учетной записи (то есть, до ее удаления).
Пользователи думают, что персональные данные, которые они вводили на тех или иных ресурсах, принадлежат им. Но на самом деле это не так. При регистрации пользователь ставит галочку, что согласен с условиями соглашения об использовании ресурса. Большинство людей ставит галочку, соглашение даже не открывая. Те немногие, кто открыл, редко читают его внимательно. А там как раз отмечено, что владелец ресурса имеет право удалить или заблокировать учетную запись пользователя, если тот будет вести себя неправильно. Про «неправильно» обычно написано общими словами, с размытыми формулировками, которые развязывают руки владельцам ресурса.







