
Полная версия
Цифра и интеллект. 50 сюжетов об искусственном интеллекте
Температура– параметр, который контролирует в LLMслучайность при генерации текста. При минимальной температуре модель выбирает очередное слово с максимальной вероятность. Это режим «зануды», когда ответы предсказуемы и практически всегда совпадают при повторном запросе. Чем выше температура, тем больше диапазон вероятностей при выборе очередного слова. Это режим «фантазера», когда могут выбираться менее вероятные ответы.
Разработчики LLMстараются соблюдать баланс температурного режима. Никому не интересен собеседник-зануда. Никому не нужен собеседник, у которого фантазия бьет через край, превращаясь в поток лжи. Самые умные LLMмогут подстраивать текущее значение температуры под запрос пользователя, оценивая по контексту, какой уровень строгости нужен.
Предположим, как галлюцинировал чат-бот в нашем пример.
Возможно, в романе «Дорога уходит в даль» есть трусливый персонаж (ничего не можем сказать – не читали). Токен романа связан с токеном «Александр» весом, близким к 1 (максимальным). Этот токен и был выбран. Токен «Александр» связан большими весами с токенами «Блок», «Пушкин», «Македонский». Александр Македонский не писатель и не поэт – не подходит. А из двух Александров случайно выбран Александр Блок.
Это не описание реального механизма галлюцинации, а просто предположение, основанное на здравом смысле. При этом Блок в качестве автора романа теоретически мог быть выбран, даже если бы температура LLMбыла минимальной. Или, может быть, не Блок, а Александр Сергеевич Пушкин.
Из всего вышесказанного вытекает печальный вывод – галлюцинации LLMнеизбежны, так как в ответы заложены механизмы случайности. При этом эксперты отмечают, что самое страшное в галлюцинациях LLM– их хорошая маскировка под правдоподобность. Если в ответе из 10 фрагментов большая часть будет очевидно правдива, то оставшиеся сомнительные пункты легче принимаются на веру.
Так в ответе чат-бота первая часть про Страшилу сразу настроила нас на позитивный лад. И если бы не школьные знания о том, что Александр Блок – знаменитый поэт, а не писатель, галлюцинация вполне могла бы сойти за правду.
Классический пример галлюцинаций в генерации изображений – количество пальцев на руках персонажей. Проблема заключалась в том, что рука — это не просто "рука". Она может быть в разных позах, сжатой, открытой, держащей самые разные предметы, которые пальцы могут скрывать.
Правда, современные генераторы изображений проблему победили. Не исключено, что каким-то искусственным способом (вроде дополнительного обучения пересчету пальцев на разных изображениях). Да и галлюцинации в изображениях – это совсем не страшно. После художников-авангардистов семь пальцев на руке – это не галлюцинация, а почти реализм.
Поэтому вернемся к текстам, к языку, который – основа разума.
Отметим, что рассуждающие LLMподвержены галлюцинациям значительно меньше своих менее умных сестер. Разбиение задачи на этапы, постоянная проверка корректности промежуточных выводов и итогового решения – хороший способ минимизировать ненужные фантазии. Только способ дорогой и не всегда уместный. В простых диалогах, вроде приведенных выше, излишние рассуждения буду раздражать пользователей не меньше галлюцинаций.
Возникает закономерный вопрос. Почему бы не прикрутить температуру LLMдо минимума, зачем эти эксперименты с температурными режимами? Ответа два, и оба подтверждают – от галлюцинаций LLMнам никуда не уйти.
Во-первых, без случайности в подборе слов, общение с LLMбудет настолько скучным и пресным, что привлечь миллиарды пользователей не получится. А ведь как-то еще нужно будет оправдывать триллионы долларов инвестиций.
Во-вторых, галлюцинации LLM– это основной и практически единственный пока способ, как генеративный ИИ может творить. Об этом творчестве теперь и поговорим.
LLM, вопреки распространенному мнению, вполне способны генерировать новые полезные текстовые материалы. Их архитектура просто кричит – попросите меня, и я завалю вас оригинальными текстами на любой вкус. А если очень попросите, я фантазию при генерации не буду ограничивать.
Весь вопрос – что с этим творчеством делать?
Оно вполне подходит для мозговых штурмов, когда на первом этапе принимаются и фиксируются любые, даже самые бредовые идеи. Важно только последующий анализ всех идей проводить с использованием критического, логического и системного мышления.
Но, как выяснилось, качество генерации новых идей у современных LLMвполне приличное. Это подтвердило интересное исследование, проведенное в США. В нем приняло участие более 100 экспертов с учеными степенями из разных университетов. Цель исследования – выяснить, кто лучше генерирует идеи: люди или LLM.
Половина экспертов генерировала новые идеи в области обработки естественного языка. Для серьезного отношения к делу этих экспертов мотивировали финансово. Также генерацией новых идей по этой теме занялась специально обученная LLM. Затем все идеи собрали, перемешали, при помощи другой LLMстилистически обработали, чтобы они по форме выглядели одинаково. И предложили второй групп экспертов оценить идеи по четырем критериям.
Результаты впечатлили исследователей. Идеи, сгенерированные ИИ, получили от людей-экспертов более высокие оценки по критериям новизныи увлекательностипо сравнению с идеями людей. При этом по критерию осуществимостиидеи ИИ оказались немного ниже, а по эффективности– немного выше, чем идеи людей, хотя эти различия не были статистически значимыми.
Так отрицательная сторона медали (галлюцинации) обратилась положительной стороной (генерация новых идей). При этом генеративный ИИ отлично помогает при обработке массива накопленных идей: в их структурировании, оценке, обосновании, сопоставлении. Поэтому эксперты предрекают отдельную революцию в научных исследованиях, которой будет посвящен один из следующих сюжетов.
Но нужно всегда помнить. Новые идеи от ИИ – это фантазии, которые в общем случае не имеют ничего общего с возможностью их реального воплощения. Пока только человек, владеющий когнитивными способностями и нужными профессиональными компетенциями способен отобрать полезные и перспективные и довести их до ума.
Завершим сюжет ответом на последний вопрос – о деградации самообучающегося ИИ. Судя по всему, такая перспектива есть, и сегодня она математически обоснована.
Российские ученые разработали математическую модель, описывающую, как меняется генеративный ИИ, обучаясь на данных, которые сам же и породил. Они не анализировали отдельные ошибки и галлюцинации LLM. Ученые рассмотрели и математически описали эволюцию распределений вероятностей в многомерном информационном пространстве модели в случае ее самообучения.
Эволюция с математически доказанной определенностью приводила модель к одному из двух сценариев:
первый– модель становится предельно уверенной в любых своих ответах, игнорируя все многообразие реальности;
второй– у модели проявляется неограниченный рост ошибок, в своих ответах она деградирует до уровня хуже случайного угадывания.
Пока данная проблема не критична, так как еще достаточно внешних данных, которые можно предлагать генеративному ИИ для обучения. Полностью закрытого от внешнего мира самообучения LLMнет, предложенная российскими учеными модель пока носит чисто теоретический характер.
Однако даже частичное неконтролируемое вовлечение в работу ИИ данных, которые порождаются им самим или его собратьями, может приводить к постепенной деградации. Каждый кредит, который выдан (не выдан) по рекомендации ИИ, меняет банковскую статистику. Как это в итоге повлияет на дальнейшие решения – предсказать сложно. А учитывая, что в видимом интернете все больше и больше результатов генерации самых разных LLM, процесс обучения ИИ давно перестал быть полностью контролируемым человеком.
Резюме. Генеративный ИИ, несмотря на свои впечатляющие успехи, в том числе в творчестве, весьма далек от того, чтобы человечество в целом и каждый человек в отдельности могли бы на него полностью положиться. Это пока – мощный и полезный инструмент.
Часть 4. Важные и интересные концепции
Сюжет 16. Интеграция решений в генеративном ИИЕсли перед коллективом нет цели,
то нельзя найти способа его организации.
Антон Макаренко
Обработка естественного языка – это основа человеческого мышления. Это не только чтение – восприятие и обработка печатного текста. Это также восприятие и обработка устной речи, то есть восприятие и обработка аудио информации. В книгах встречаются самые разные изображения – картинки, таблицы, схемы, диаграммы, которые тоже нужно воспринимать и обрабатывать.
При общении с другими людьми человек смотрит на собеседника, параллельно воспринимает и обрабатывает визуальную информацию – мимику и жесты. Остроты его мышлению добавляет тактильная информация, которую он может получить от собеседника.
Человек продолжает мыслить, даже когда вокруг него нет других собеседников, книг или печатных изданий. Гуляя по лесу или по берегу моря, он воспринимает окружающую красоту, которая также вносит свою лепту в мыслительную деятельность.
Разработчики ИИ понимают описанное выше богатство восприятия человеческого интеллекта. Поэтому очевидной стала задача по расширению возможностей генеративного ИИ воспринимать не только печатный текст, но и другие информационные потоки.
Так появился на свет мультимодальный ИИ.
Мультимодальный ИИ – это архитектурная модель на основе нейросетей, которая способна воспринимать и обрабатывать несколько типов данных одновременно. Такие типы данных называют модальностями. У каждой мультимодальной модели свой набор модальностей, одной из которых является текст.
К стандартным модальностям относят:
текст: предложения, фрагменты текста, тексты на разных языках;
изображения: рисунки, фотографии, схемы, графика и символы;
аудио: речь, музыка и другие звуковые сигналы;
видео: последовательности изображений, в том числе сопровождаемые звуком.
Мультимодальные модели могут воспринимать сенсорные данные, которые поступают от датчиков и иных устройств, воспринимающих внешнюю среду, например, сигналы GPS.
Создание мультимодального ИИ – прогрессивный, перспективный и неизбежный шаг на пути к созданию AGI– общего ИИ. Человеческий мозг интегрирует информацию из разных органов чувств, чтобы создать полную картину мира. Также мультимодальный ИИ способен глубже и точнее понимать разнообразные сигналы, которые поступают от пользователей или устройств, воспринимающих окружающий мир.
Самые первые мультимодальные модели – это генераторы изображений по текстовому описанию. На них, по сути, отрабатывалась ключевая идея мультимодального ИИ – создание единого семантического векторного пространства для нескольких модальностей.
Кратко архитектуру мультимодальной модели можно описать так.
Для каждой модальности создается специализированный кодировщик в собственное векторное пространство. Для текстовой информации – это трансформер, лежащий в основе LLM. Для изображений обычно используются сверточные нейросети (CNN), которые по другим алгоритмам делают то же самое – преобразуют входную информацию (изображения) в векторные представления. Свои кодировщики разработаны для аудио и видео информации, но суть одна – на выходе мы получаем векторные пространства для каждой модальности.
Следующий ключевой компонент мультимодальной модели – модуль, интегрирующий векторные представления разных модальностей в единое семантическое векторное пространство.
В этом пространстве векторные представления изображений черных котов, слов «черный» и «кот», звука «мяу» будут близки. Эта близость позволит, например, по запросу «сделай озвученное видео про черного кота» сгенерировать соответствующий фильм, где черный кот будет мяукать и что-нибудь делать («что-нибудь» можно задать в дополнительном контексте запроса).
Обучаются мультимодальные модели на согласованных наборах данных разных форматов. Обучение с нуля требует огромных вычислительных ресурсов и больших наборов данных. Так мультимодальная модель CLIPот OpenAIобучалась на 400 миллионах пар «текст-изображение», собранных из интернета. Для обучения использовались 256 мощных графических процессоров в течении нескольких недель. Второй, более экономичный вариант – использование предварительно обученных моделей с их дообучением на специфических задачах.
Как используются мультимодальные ИИ? Почему эти архитектурные решения набирают популярность? Попробуем ответить на эти важные вопросы.
Мультимодальный ИИ более эффективен в решении задач, для качественного выполнения которых нельзя обойтись без взаимодействия с различными видами входной информации.
Многие публикации включают различные изображения – рисунки, схемы, таблицы. Если в таких публикациях анализировать только текстовую часть, неизбежна потеря качества обработки – существенные моменты останутся за пределами внимания традиционной LMM. Особенно это критично для научных публикаций, где изображения часто несут ключевую информационную нагрузку. Мультимодальный ИИ способен в комплексе обрабатывать такие публикации.
При генерации изображений и видео пользователю часто хочется использовать в качестве основы уже существующие изображения. Мультимодальная модель способна в запросe воспринять и комплексно обработать текстовую информацию и изображения. Например, сделать видео на основе готового изображения и описания, что пользователь хочет в этом видео увидеть.
Похожая возможность мультимодальной модели позволяет пользователям находить информацию, сочетая текстовые запросы с изображениями. Такая возможность полезна в сфере продаж. Также в сфере продаж сегодня популярна генерация описания товара по его изображению и изображения товара – по описанию.
Мультимодальная модель может анализировать озвученное видео с субтитрами, учитывать при этом жесты и мимику, и в результате делать более точный перевод.
Мультимодальные модели применяется в медицине. Специальные модели могут анализировать рентгеновские снимки, графические результаты исследований и текстовые записи из медицинской карты пациента для более точных диагнозов.
Мультимодальные модели используются для анализа чертежей и технических документов, и это позволяет инженерам быстрее разрабатывать и тестировать новые проекты, улучшать процессы проектирования и производства.
Находят применение мультимодальные модели в сфере образования. Процесс обучения по многим предметам предполагает параллельное восприятие и обработку текстовой и визуальной информации. Поэтому мультимодальные модели используются на перспективных обучающих платформах с высоким уровнем интерактивности.
Интересное решение для игровой компьютерной индустрии предложила компания Nvidia. Оно связано с функционалом неигровых персонажей в компьютерных играх. Речь идет о персонажах, которые управляются не игроками, а алгоритмами самой игры. Об этом решении мы поговорим в одном из следующих сюжетов.
Мультимодальные модели – очередной рубеж в развитии ИИ. Они приближаются к человеческому восприятию мира, где разные источники информации естественным образом дополняют друг друга.
В мультимодальном ИИ предусмотрена интеграция технологий восприятия и обработки поступающей информации. Но есть еще один пласт интеграционных процессов, где задействован генеративный ИИ. Этот пласт связан с исполнительными функциями, которые необходимы для решения многочисленных задач, ежедневно возникающих перед человеком в личной, общественной и профессиональной жизни.
Частично мы эту тему затронули, когда рассказывали о встроенных модулях и инструментах, которые могут использовать рассуждающие ИИ в ходе решения сложных задач. Теперь на эти интеграционные механизмы можно посмотреть в более широком контексте.
LLMработает просто – человек формирует запрос и в ответ получает результат. Запрос – «напиши приглашение на праздник». Результат – готовое письмо-приглашение. Но в нем нет даты, места и времени (если их, конечно, не включили в контекст запроса).
Зато дата, время и место есть в календаре человека. Если LLMполучит доступ к календарю, то сможет составить приглашение более точно. А если еще интегрироватьLLMс сервисом прогнозов погоды, она сможет вставить в приглашение что-то вроде «будет дождь, не забудьте прихватить зонтик».
Подобных ситуаций, гдеLLMв интеграции с другими онлайн-сервисами способна решать личные задачи человека, можно придумать много. Еще больше таких задач в профессиональной жизни белых воротничков. Поэтому ведущие разработчики ПО во главе с Microsoftсоздают платформы автоматизации деловых процессовна основе интеграции ИИ с различными инструментами и онлайн-сервисами. В публикациях часто используется синоним – рабочие процессы.
Ключевая особенность таких решений основана на пассивности традиционныхLLM. Они отвечают и решают задачи только после того, как их об этом прямо попросят. Поэтому нужно не только интегрироватьLLMс инструментами и онлайн-сервисами. Нужно еще организовать их согласованную работу в соответствии с расписанием, настроенным пользователями.
Платформы, которые обеспечивают подобную интеграцию и автоматизацию деловых процессов на основе ИИ, получили название AI Workflow(дословный перевод «ИИ рабочих процессов»). AI Workflowобеспечивает автоматизацию по заранее составленному плану действий, который указывает, что, кто и как должен делать. Поэтому за AIWorkflowвсегда стоит человек, который принимает ключевые решения и настраивает управление выполнением задач.
Опишем применение такого подхода для решения одной задачи, весьма популярной сегодня среди блогеров. Задача такая – генерировать в определенное время обзор новостных сайтов на личных страничках блогера в социальных сетях и мессенджерах.
Первый шаг – блогер формирует список новостных страниц, на основе которых будут делаться обзоры, и список ресурсов для публикации. Второй шаг – блогер пишет запрос, по которому на основе этих страниц LLMделает обзор (формат и специфика обзора описывается в запросе). Третий шаг – описывается процедура автоматической публикации обзора на заданных ресурсах. Четвертый шаг – блогер указывает точное время, когда весь этот деловой процесс запускается.
Блогер может в любой момент поправить схему: добавить или удалить новостную страницу, улучшить запрос, изменить время запуска. Он по-прежнему является главным действующим лицом, у которого роль писателятрансформируется в роли координатораи критика.
Платформы, которые автоматизируют подобным образом работу специалистов в разных профессиональных сферах деятельности, становятся все более популярными. Как правило, они предполагают составление не простых расписаний, а более сложных планов действий. В таких планах указывается не только время, но и сложные условия запуска или остановки тех или иных деловых процессов. При этом управление отдельными частями общего плана могут выполнять разные сотрудники компании.
И здесь возникает закономерный вопрос. А нельзя ли всю работу по составлению планов и координации их выполнения тоже поручить ИИ? Отвечая на этот вопрос, любознательное человечество сформировало концепцию ИИ-агентов, о которой речь пойдет далее.
Резюме. Сегодня мэйнстрим развития генеративного ИИ – интеграцияLLMс различными технологиями. Во-первых, с технологиями восприятия, интеграции и согласованной обработки разнородной информации. Во-вторых, с инструментами и онлайн-сервисами, способными решать самые разные практические задачи, возникающие перед человеком.
Сюжет 17. ИИ-агенты – мифы, реальность, перспективыУ того, кто ничего не делает,
всегда много помощников.
Лев Толстой
ИИ-агенты – модное и, по мнению многих экспертов, самое перспективное направление развития генеративного ИИ. Об ИИ-агентах слышали практически все, кто хотя бы изредка интересуется современными технологиями. И большинство людей уверены, что тема эта – новая, возникшая в ходе революции генеративного ИИ.
Однако это не совсем так, поэтому далее – немного истории.
Примерно 50 лет назад в исследованиях по ИИ появилось отдельное направление, которое занималось программными агентами. Оно формировалось на стыке искусственного интеллекта, информационных технологий и компьютерных сетей.
Одно из толкований слова агент— лицо, действующее по чьему-либо поручению. Страховой агент по поручению страховой компании продает пакеты страховых продуктов и услуг. Агент по недвижимости помогает в купле-продаже квартир. Рекламный агент специализируется на продаже рекламных услуг, рекламных площадей или рекламного времени. В личной и профессиональной жизни по многим вопросам проще обратиться к нужному агенту.
Программный агент — это автономный программный модуль, который в интересах владельца решает конкретный круг задач. Круг задач определяются двумя факторами. Во-первых, возможностями, которые заложили в программного агента разработчики. Во-вторых, конкретными целями и задачами владельца.
Первый всплеск интереса к программным агентам связывают с массовым распространением персональных компьютеров. Эйфория тех лет распространялась на многие инновации, в том числе и на эту. Однако модели классического искусственного интеллекта, на которые опирались разработчики, не давали серьезных результатов.
Полезными программными агентами тех лет считают поисковых роботов (пауков), обслуживающих поисковые машины Google, Яндекса. Пауки перемешаются по интернету от одного сайта к другому, от одной страницы сайта к другой. При переходе на страницу они индексируют содержание и помечают ее как просмотренную. Полученный отчет поисковый робот отправляет поисковой машине. Благодаря этим программным агентам поисковые сервисы по-прежнему постоянно используются в повседневной жизни.
В других сферах качество работы программных агентов не позволяло завоевать сердца и умы пользователей. Программные агенты для ответов на звонки, для планирования дня, для управления электронной почтой, для мониторинга личного расписания не получили широкого применения. Они оставались игрушками для энтузиастов.
Однако исследования продолжались. Тему считали перспективной, и многие эксперты понимали, что возможный прорыв в области ИИ может в корне изменить ситуацию (что и произошло в 2022 году).
Пока же формировались требования к программным агентам. Выполнение этих требований – необходимое условие для успеха инновации. Перечислим те, которые специалисты тех лет считали ключевыми. Они актуальные и для современных ИИ-агентов.
Автономность. Программный агент должен действовать автономно от владельца, в том числе самостоятельно принимать решение о запуске и приостановке своих действий. Автономность не исключает настройку параметров программного агента под цели и задачи конкретного человека.
Адаптивность. Программный агент должен воспринимать внешнюю среду, отслеживать изменения в ней, подстраиваться под них. Под внешней средой понимается та информация, которую программный агент получает из разных источников в сети интернет. Программные агенты будут адаптироваться к сигналам и данным от устройств, подключенных к глобальной сети. От датчиков состояния здоровья на теле человека до умных холодильников.
Коммуникабельность. Программный агент должен взаимодействовать с другими агентами, передавать им и получать от них нужные сведения. Обмениваются сведениями однотипные программные агенты, выполняющие схожие задачи для разных владельцев. А также агенты, решающие разные задачи конкретного владельца.
Например, программный агент, помогающий планировать расписание человека, взаимодействует с агентами, продающими билеты или бронирующими гостиницы.
Корпоративность. Программные агенты, действующие по единым стандартам и протоколам, должны уметь кооперироваться для решения сложных или распределенных задач. В этом случае группа программных агентов должна уметь координировать действия для достижения общих целей. Иными словами, каждый программный агент имеет представление о целях и задача других агентов, а также о том, как они будут реализовываться.
Предвидение. Программные агенты должны предвидеть потребности и пожелания владельцев. Это не исключает действия по прямым указаниям, но максимальную благодарность владельцы почувствуют именно за предвидение своих цифровых помощников. Большие перспективы в этом направлении открываются, когда программные агенты получат доступ к цифровым профилям владельцев.







