
Полная версия
Цифра и интеллект. 50 сюжетов об искусственном интеллекте
Пятая революция – интернет-технологии. В 1991 году интернет стал общедоступным. За несколько лет к нему подключились миллионы компьютеров. Первый миллиард пользователей интернет получил в 2005 году. Сегодня пользователей интернета в мире – более 5 миллиардов. Информационные ресурсы, поисковые машины, социальные сети и разнообразные онлайн-сервисы – вот краткий перечень основных интернет-технологий.
Информационные революции меняли мир кардинально.
Письменностьпозволила сохранять и передавать потомкам накопленные человечеством знания. Книгопечатаниепоставило эту практику на поток, что позволило вовлечь в работу с информацией практически все человечество. Телеграф, радио и телефонна порядки ускорили коммуникации между людьми, приучив человечество к работе с актуальной информацией. Персональные компьютеры и смартфонывооружили каждого человека эффективным инструментом для работы с информацией. Интернетсделал практически любую информацию доступной, онлайн-взаимодействие – нормой.
Попробуем обосновать, что стремительное распространение генеративного ИИ тоже кардинально трансформирует жизнь человечества и поэтому по праву называется информационной революцией. При этом не будем забегать вперед и рассуждать об изменениях, которые может привнести в нашу жизнь сильный ИИ. Это уже будет не революция, а технологическая сингулярность, о которой речь в одном из следующих сюжетов. Будем говорить только о текущем состоянии генеративного ИИ и его ближайших перспективах.
Перечислим основные факторы.
Партнер в познании. До появления генеративного ИИ человек занимался познанием окружающего мира индивидуально или в сообществе с себе подобными. Инструменты, которые он для этого использовал, были всего лишь инструментами. Наскальная живопись, глиняные таблички, папирусы, перо и бумага, печатные книги и журналы, телеграф и телефоны, персональные компьютеры и смартфоны, многочисленные программные продукты. Все это были технологические средства для работы с информацией. Их эффективность повышалась, но инструменты оставались инструментами.
Генеративный ИИ доказал, что способен демонстрировать многие когнитивные способности, ранее относящиеся только к человеку. Он стал не просто забавным собеседником – это теперь всегда доступный и достаточно надежный партнер в когнитивной работе. Многие задачи, для которых нужны интеллектуальные усилия, генеративный ИИ решает не хуже человека. Именно как партнера воспринимают генеративный ИИ все больше и больше людей.
Общение с миром техники. До недавнего времени человек общался с окружающими его технологическими устройствами на их языке. Это мог быть язык механических воздействий – например, так человек управлялся с транспортными средствами. Это мог быть язык фиксированных инструкций – например, управление приборами, использование интерфейсов компьютерных программ, написание программного кода.
Генеративный ИИ переводит наше общение с миром техники на естественный для нас язык. Мы теперь можем общаться практически с любыми устройствами, использую обычную письменную или устную речь. Как нам кажется, интернет вещей будет развиваться в этом направлении. И это безусловно революционная трансформация.
Рынок труда. Оценки событий, который происходят на рынке труда вследствие внедрения генеративного ИИ, разнятся. Кто-то предрекает почти полное замещение интеллектуального труда ИИ-технологиями. А после оптимизации технологий, позволяющих создавать локальный ИИ, – замещение умными роботами людей многих профессий. Кто-то скептически приводит в пример статистику, которая говорит о том, что большинство запросов к ИИ – это баловство и глупости. Что организации не спешат перестраивать свои бизнес-процессы, а массовые увольнения – фейки или не связанные с ИИ последствия конкретных экономических провалов.
Во многом здесь, как и в 1950-е годы, негативную роль играют громкие заявления и завышенные ожидания. И тем не менее революционные изменения происходят, пусть пока только в некоторых направлениях Генеративный ИИ постепенно трансформирует сферу разработки программного обеспечения. Полезность искусственного когнитивного партнера оценили маркетологи, рекламщики, дизайнеры. Уже видна революция в организации научных исследований.
Цифровой контент. То, что происходит на рынке цифрового контента, иначе как революцией назвать нельзя. Собственно, генеративный ИИ свое название получил за способность быстро, качественно и дешево создавать тексты, изображения, аудио и видео.
Количество цифрового контента, который создают разные модели генеративного ИИ, растет как на дрожжах. Во многих случаях его уже невозможно отличить от контента, который создают люди.
Еще один фактор – революционные изменения, связанные с достоверностью цифрового контента. После пятой информационной революции психологи и социологи заговорили о том, что для нормальной жизни в цифровом информационном пространстве человеку нужно развивать критическое мышление. После шестой информационной революции без критического мышления жить в мире фейков и полуправды будет сложно. Точнее, жить-то будет проще, но вот куда такая жизнь может привести – большой вопрос.
Новая аналитика. До недавнего времени аналитическая работа строилась по одной схеме. Человек через поисковую систему запрашивал в интернете информацию, выбирал нужные источники и затем уже на их основе занимался непосредственно аналитикой. Так школьники выполняли домашние проекты, студенты – курсовые и дипломные работы, ученые – научные обзоры, экономисты – аналитические отчеты. Подобная работа требовала серьезных когнитивных усилий.
Сегодня такая схема устаревает с пугающей скорость. Генеративный ИИ прекрасно справляется со школьными домашними заданиями и проектами, студенческими работами, научными обзорами, обобщением и анализом информации в любых сферах. Здесь уместно вспомнить тезис, который мы неоднократно повторяем. Искусственный интеллект делает сильного сильнее, а слабого – слабее.
Сфера образования. Очень печальная тема, так как образование – одна из самых консервативны сфер человеческой деятельности. Это объективная ситуация. Плоды основного образования отложены на годы в будущее, а революционным изменениям государственная система образования умеет хорошо противостоять. Да и коренные изменения невозможно проводить быстро из-за длительных согласований. Поэтому во время шестой информационной революции сфера образования становится заложником лозунгов «не навреди!» и «работает – не трогай!»
Тем не менее революционные изменения в сфере образования происходят, только носят они стихийный характер. Школьники и студенты, как любые нормальные люди, свято придерживаются важного психологического принципа, которые предполагает приложение минимальных усилий для достижения заданного результата. Генеративный ИИ прекрасно помогает им этот принцип соблюдать.
Военные конфликты. Войны – одно из самых древних занятий, которым тысячелетиями так любило заниматься неугомонное человечество. Первая и Вторая мировые войны своими страшными результатами охладили эту любовь. Ядерное оружие заставило человечество вести себя предельно аккуратно. Но военные конфликты по-прежнему вспыхивают в самых разных горячих точках планеты.
Пока еще главным участником этих трагических событий остается человек. Даже разного рода беспилотные устройства военного назначения все еще в значительной степени управляются людьми. Но ситуация, похоже, неуклонно движется к революционным изменениям в военном деле. На сцену выходят автономные устройства военного назначения. Если они будут воевать между собой, сокращая при этом реальные человеческие жертвы, то это вроде бы лучше войны с активным участием людей. Но вот только есть большие сомнения, что воевать такие автономные системы будут только друг с другом.
Угрозы безопасности. Последний фактор связан со стремительным увеличением угроз на всех уровнях. Подделка голоса открывает небывалые возможности перед мошенниками. Доказаны способности генеративного ИИ по взлому информационных систем. Вызывает большие опасения встраивание генеративного ИИ в самые разные управленческие контуры человеческой цивилизации.
Резюме. Наверное, это не все факторы. Но и перечисленных достаточно, чтобы утверждать: генеративный ИИ запустил новую информационную революцию, шестую по счету. Хотелось бы верить, что не последнюю.
Часть 3. Общее представление о генеративном ИИ
Сюжет 10. Ключевые технологии генеративного ИИИнтеллект – это способность
избегать выполнения работы, но так,
чтобы она при этом была сделана.
Линус Торвальдс
Считается, что революция генеративного ИИ началась в ноябре 2022 года с выходом в публичное пространство чат-бота ChatGPT3.5, разработанного компанией OpenAI. Но революции на голом месте не происходят. Все второе десятилетие XXI века велась подготовительная работа – разрабатывались, апробировались и совершенствовались технологии работы с нейросетями.
За каждой технологией скрываются сложные математические понятия и алгоритмы. Как мы уже говорили, погружаться в них – удел специалистов по проектированию, разработке и обучению нейросетей. Поэтому мы познакомимся лишь с концепциями, которые предельно кратко описывают эти ключевые технологии. По каждой технологии любознательный читатель при желании самостоятельно сможет найти публикации нужного уровня сложности и детализации.
Сначала напомним, что ключевой проблемой нейросетей предыдущего поколения была необходимость вручную отбирать и размечать данные, на которых нейросети обучались. Громоздкая задача даже для специализированных нейросетей. Для универсальных – задача просто неподъемная. Поэтому исследователи в первую очередь искали способы, как обучать нейросети на исходных неразмеченных данных, которых на просторах интернета – воз и маленькая тележка.
Первая технология – генеративно-состязательная нейросеть (Generative adversarial network, GAN). Это архитектурное решение, состоящее из двух конкурирующих нейросетей, каждая из которых в процессе состязания обучается сама и помогает обучаться конкуренту.
GANбыла представлена на суд общественности в 2014 году.
Концептуальная идея проста и гениальна.
Первая нейросеть генерирует объект, относящийся к заданной категории. Например, изображение кота. Эту нейросеть так и называют – генератор. Новое изображение – это его (генератора) выход.
Выходные данные генератора подаются на вход второй нейросети, которую назвали дискриминатор. Чтобы внести элемент неопределенности, на вход дискриминатора также периодически подаются реальные изображения. Получив изображение, дискриминатор должен определить – оно реальное или сгенерированное.
Если дискриминатор ошибся и посчитал сгенерированное изображение реальным, он проиграл этот раунд. Победитель генератор настройки не меняет. Проигравший дискриминатор корректирует параметры своей нейросети, улучшая возможности распознавания.
Если дискриминатор точно определил, что поданное ему на вход изображение – плод работы генератора, он считается победителем. Победитель сохраняет настройки, а проигравший (генератор), получив соответствующий сигнал, свои настройки корректирует, улучшая способности к генерации.
Если на вход дискриминатора было подано реальное изображение, то в этом раунде генератор отдыхает. Если дискриминатор ошибается, он корректирует свои настройки. Если правильно определяет, что изображение реальное, начинается следующий раунд.
Предварительно для GANсобирается набор исходных данных. Исходные данные нужны генератору – это источник его вдохновения. Исходные данные нужны дискриминатору – по ним определяется, правильно ли он определил источник изображения.
GANмогут работать с разными данными: изображениями, текстами, аудио, видео. Главное – ручная разметка исходных данных не нужна, все обучение происходит в автоматическом режима.
Вторая технология – автоэнкодеры. Это базовая техника генеративного ИИ и машинного обучения, на основе которой строятся более сложные модели. Понятно, что в ее основе тоже лежат нейросети.
Автоэнкодер предназначен для кодирования данных в более компактное представление и затем декодирование компактного представления в исходную форму. Процесс полностью автоматический. Автоэнкодер учится сам, без необходимости в явных метках или человеческом вмешательстве. Во время обучения он автоматически находит способы, как лучше всего представить данные в компактной форме.
Автоэнкодер состоит из двух частей. Первая часть – энкодер– переводит исходные данные в более компактную форму. Вторая часть – декодер– пытается восстановить исходные входные данные из закодированного представления. Цель состоит в том, чтобы обеспечить максимальное сходство выходных данных с оригинальными входными, показывая, что кодирование сохраняет основные признаки.
Это напоминает работу программ-архиваторов, только более умную. Автоэнкодер способен понять важные особенности данных (так называемые скрытые признаки) и запоминает их вместо всех данных. На изображениях, например, он может запомнить очертания объектов или относительное положение объектов друг к другу. Из этого приблизительного закодированного описания данные восстанавливаются. Понятно, что при этом происходят потери, но если они не велики, то работа автоэнкодера признается удовлетворительной.
В обучении нейросетей автоэнкодеры используется для уменьшения размерности или сжатия данных, а также, например, для удаления шума с изображений.
Третья технология – стабильная диффузия (Stable Diffusion, SD). Эта технология лежит в основе нейросетей, которые генерируют изображения и видео.
Для пользователей генерация изображений и тем более видео выглядит как магия. Как компьютер может генерировать настолько реалистичные изображения и делать это так быстро? Еще несколько лет назад это казалось совершенно невозможным. SDпозволила сделать фантастику реальностью.
На концептуальном уровне модель SDпроста и гениальна.
Модель учится на исходном наборе парных изображений. Одно изображение в паре – реальное изображение. Второе – то же изображение, в которое по определенному алгоритму добавляются искажения (шум). Узнать во втором изображение исходное – сложно или невозможно. Для этого второе изображение нужно очистить от шума.
Этому и учат нейросеть, которая лежит в основе SD. Получив на вход искаженное изображение, SDпытается определить добавленный к изображению шум, удалить его и проявить оригинал. То, что получилось, сравнивается с первым изображением (оригиналом). По результатам сравнения в нейросети корректируются параметры, чтобы она проявляла оригиналы все лучше и лучше.
Добавление шума и его удаление выполняются за ряд итераций. Такой подход последовательного пошагового приближения к образцу (идеалу) используется не только в SD, а практически во всех технологиях машинного обучения.
Когда SDобучена делать прекрасное из шума, ее можно начинать использовать. Пользователям предлагается описать свои пожелания и передать это SD-модели.
На вход SD-модели поступает текстовый запрос, в котором описывается, что пользователь хочет получить на изображении. Запрос разбирается, кодируется и передается в информационное пространство SD-модели. В этом пространстве хранится закодированное описание сущностей, которые участвовали в процессе обучения: котов, собак, облаков, деревьев, попугаев, …
По закодированному запросу SD-модель находит в пространстве нужные сущности, определяет контекст, в котором они должны быть связаны на изображении, и запускает процесс генерации. Затем технология SDочищает сгенерированное изображение от ненужного шума.
Четвертая технология – сверточные нейросети (Convolutional Neural Network, CNN). CNN– технология не новая, ее придумали еще в XX веке. Но она развивается и продолжает активно использоваться.
Если изображения показывать обычной нейросети, то она будет воспринимать все пиксели, а потом по этим пикселям будет учиться распознавать котов. Человек делает это совсем по-другому. Он видит уши, усы, плоский нос, пушистый хвост и понимает – это кот. Похожий подход к анализу изображений используют CNN.
На вход CNNпоступает изображение. Фрагменты изображения последовательно рассматриваются с помощью специального блока, которое называется ядром CNN. Уместно провести аналогии с лупой. Мы наводим ее на левую верхнюю часть страницы и начинаем читать, перемещаясь слева направо и сверху вниз.
Отличие ядра CNNот лупы заключается в том, что выделенные фрагменты изображения по правилам ядра обрабатываются и трансформируются (сворачиваются), например, в числа. Числа одно за другим по мере просмотра всех фрагментов изображения помещаются в дополнительную структуру, например, матрицу.
Предположим, у нас есть квадратное изображение. Разбиваем его по вертикали и горизонтали на 5 квадратных фрагментов – всего получается 25 фрагментов. Ядро CNNодно за другим просматривает эти фрагменты и по заложенным в него правилам последовательного заполняет числами матрицу 5 на 5. В дальнейшем решение о том, кот на изображении или не кот нейросеть принимает, анализируя матрицу.
Пятая технология – рекуррентные нейросети (Recurrent neural network, RNN). Эту технологию сегодня заменили трансформеры – ключевая технология генеративного ИИ, о которой пойдет речь дальше. Но мы решили включить концептуальное описание RNNдля лучшего понимания тех решений, которые пришли им на смену.
В обычной нейросети любой нейрон внутренних слоев имеет один вход для получения сигнала от нейрона предыдущего слоя и один выход для передачи сигнала нейрону последующего слоя. Такая конструкция плохо приспособлена для получения и обработки последовательностей, например, фрагментов текста (последовательности слов).
Для восприятия и обработки последовательностей элементов и были придуманы RNN. Узлы в такой нейросети могли иметь несколько выходов и входов. То есть, нейрон мог передавать обычный сигнал об элементе нейрону следующего слоя и одновременно передавать сигнал другому нейрон, например, соседнему в том же слое. Второй сигнал – это информация о порядке элемента в последовательности. Таким образом CNNможно было научить обрабатывать тексты, последовательности событий, статистических данных и многое другое.
RNNшироко использовались во втором десятилетии XXI века. Они, например, лежали в основе первых версий голосовых помощников Siriкорпорации Appleи Alexaкорпорации Amazon. RNNактивно применялись для машинного перевода с одних языков на другие.
Главный недостаток RNNпроявлялся при работе с длинными фрагментами текста. Чтобы хранить весь контекст приходилось помнить все и создавать для этого очень громоздкие модели RNN. Если модель упрощалась для обработки более коротких сообщений, контекст мог теряться – модель, обрабатывая конец текста, забывала о том, что было в его начале.
Все мы помним, как коряво по нынешним стандартам работали машинные переводчики еще 10 лет назад. Воспринять книгу и сохранить контекст между главами при помощи RNN– об этом не было даже речи. Нужно было принципиально иное архитектурное решение.
Шестая технология – трансформеры. Новое архитектурное решение в 2017 году представили на суд общественности исследователи из GoogleBrain. Именно оно дало старт шестой информационной революции – революцию генеративного ИИ. Революцию готовили в исследовательских лабораториях лидеров ИИ-рынка. Пять лет полученные результаты (например, ChatGPT1, 2, 3) до широкой общественности не доводились. Когда в ноябре 2022 года количество перешло в качество, мир узнал о ChatGPT3.5.
Как обычно, идея на концептуальном уровне проста и изящна, хотя для ее реализации потребовались годы исследований. RNNвоспринимают и кодируют отдельные слова и их порядок следования в предложении. Трансформеры воспринимают и кодируют отдельные слова и их контекстное окружение. Например, есть фрагмент «черный кот на крыше». При кодировании слова «кот» трансформер кодирует и контекст – связь «кота» с «чернотой» и «крышей».
В сравнении с RNNтакой подход был существенно экономичнее по вычислительным ресурсам, необходимым для обработки текстов. Кроме того, он позволял разбивать большие фрагменты текста на блоки, а затем воспринимать и обрабатывать их параллельно. Таким образом существенно повышалась скорость работы технологии.
О трансформерах речь пойдет в одном из следующих сюжетов.
Резюме. Революцию генеративного ИИ, стартовавшую в конце 2022 года, подготовили технологии – оригинальные, простые на идейном уровне, но предельно сложные в реализации и математическом обеспечении. Сколько еще таких идей вертятся в исследовательских коллективах – нам еще только предстоит узнать.
Сюжет 11. Данные, которые используют для обученияДети учатся на примере взрослого,
а не на его словах.
Карл Юнг
Практически любой человек знает или хотя бы слышал, что генеративный ИИ обучается на больших массивах данных. Относительно этих массивов существует два предубеждения, широко распространенных среди людей, не представляющих, что такое машинное обучение. Это люди, которые уже активно используют генеративный ИИ, а также люди, которые к нему только присматриваются.
Первое предубеждение – для обучения нейросетей уже использованы все данные, накопленные человечеством. Второе предубеждение – нейросети обучаются на абсолютно случайных данных, которые они вытягивают из интернета.
Разбираться с машинным обучением – удел квалифицированных специалистов. Но нынешним и будущим пользователям генеративного ИИ с предубеждениями лучше расстаться. Попробуем им в этом помочь. А заодно поговорим о том, как находятся, отбираются и готовятся данные для обучения самых разных моделей современного искусственного интеллекта.
Начнем с первого предубеждения.
С 2024 года в самых разных изданиях, в том числе весьма авторитетных, постоянно появляются публикации примерно с такими заголовками: «Данные для обучения нейросетей заканчиваются. Что дальше?» В подтверждение приводится, например, такое сообщение:
Осенью 2024 разработчики OpenAI обнаружили, что, несмотря на общий рост производительности самой последней языковой модели, прогресс при переходе на нее менее заметен, чем при переходе от ChatGPT-3 к ChatGPT-4. Они связывают это с тем, что модель обучили уже на всех легкодоступных данных.
Читатель, уверены, уже отметил, что ключевое слово здесь «легкодоступные», а не слово «все». И это действительно так – заканчиваются легкодоступные данные, которыми могут пользоваться разработчики генеративного ИИ. Но, значит, есть еще и труднодоступные данные?
Здесь придется сделать небольшой экскурс во всемирную паутину.
Мы так часто употребляем слова «интернет», «всемирная паутина», «глобальная сеть», что в нашем сознании само понятие интернетассоциируется с огромным, но единым информационным пространством. Мы почему-то уверены, что можем найти в интернете все.
Не все, что пожелаем, но точно – все, что там есть. В интернете, скорее всего, нет описания и изображения семирукого шестинога. Но если есть, их можно получить, составив правильный поисковый запрос – не правда ли? В реальности – все не совсем так.
В интернете принято выделять три сегмента.
Видимый интернет (Surface Web). Это тот сегмент интернета, к которому мы получаем доступ при помощи ссылок и поисковых запросов. В нем расположены официальные сайты организаций, новостные порталы, интернет-издания и многого другое, что находится в открытом доступе. Этот сегмент интернета доступен поисковым роботам, которые постоянно индексируют веб-страницы. Googleи другие поисковые системы выдают в качестве результата только то, что находится в видимом сегменте интернета.
Глубокий интернет (Deep Web). Этот сегмент иногда называют «скрытая сеть», «невидимая сеть». Это места или контент в интернете, к которым нельзя получить доступ с помощью обычных поисковых систем. В первую очередь, это веб-страницы и базы данных, для доступа к которым нужно пройти аутентификацию, например, ввести логин и пароль. Так владельцы контента ограничивают к нему доступ.







