
Полная версия
Цифра и интеллект. 50 сюжетов об искусственном интеллекте
Ограничение доступа к цифровому контенту может быть обусловлено многими причинами. Защитой персональных данных, конфиденциальностью контента, желанием на нем заработать.
Темный интернет (DarkWeb). Более распространен термин даркнет. Это совсем небольшой сегмент интернета, для доступа к которому нужны специальные программные средства (обычные браузеры его не видят). В этом сегменте основная часть контента связана с преступной деятельностью. Искать читателю этот сегмент интернета мы категорически не рекомендуем, так как незаметно преступить закон в темном интернет проще простого.
Когда сравнивают сегменты видимого и глубокого интернета, обычно используют аналогию с айсбергом. Видимый интернет – это малая часть информационного айсберга. Глубокий интернет – его основная, гораздо более массивная часть. По некоторым оценкам глубокий интернет содержит более 90% цифровых данных. Оценки разнятся, но в любом случае закрытый цифровой контент в разы превосходит контент открытый.
Понятно, что учиться на данных из глубинного интернета генеративный ИИ в общем случае не может. Конечно, создатели ИИ-модели могут купить закрытый цифровой контент у его владельцев. В некоторых случаях владельцы свой контент и закрывают, чтобы зарабатывать на доступе к нему. Однако общей ситуации это не меняет – огромное количество закрытых данных для обучения нейросетей недоступно.
Да и с открытыми данными в видимом сегменте все не так просто.
С 2008 года некоммерческая организация Common Crawlзанимается сканированием видимого сегмента интернета и созданием его обширного архива. Результаты своей работы организация бесплатно предоставляет широкой общественности. На ноябрь 2024 года в архивах организации хранилось около 250 миллиардов страниц, 45% которых – на английском языке.
До революции генеративного ИИ деятельность организации особых возражений не вызывала. Платный контент находился в закрытом сегменте интернета, а если попадал в видимый сегмент, CommonCrowlбыла не при чем – это были происки пиратов.
Все изменилось, когда архивы CommonCrowlстали использовать для обучения своих нейросетей компании, ведущие разработку в области генеративного ИИ. Быстро выяснилось, что в архивах хранятся миллионы платных публикаций, принадлежащих крупнейшим изданиям, таким как The New York Times, The Wall Street Journalи другие.
Поисковые роботы CommonCrowl, как и поисковые роботы Google, умели извлекать платные публикации, пользуясь некоторыми скрытыми возможностями новостных лент. Но от поисковых инструментов Googleвладельцы контента признавали пользу – они увеличивали поток пользователей на их ресурсы. А вот пользы от того, что их публикации служат для обучения генеративного ИИ, владельцы не видели. Более того, уникальные возможности по генерации текстов делают искусственный интеллект серьезным конкурентом для периодических изданий и новостных агрегаторов.
Сегодня многие крупнейшие информационные ресурсы блокируют программы, которые собирают данные для обучения нейросетей. Среди них New York Times, Reutersи CNN. Поэтому пока генеративному ИИ сложно конкурировать на рынке оперативной достоверной информации. Давать объективную оценку событиям, которые произошли на днях, он не может.
Говорить, что данные для обучения нейросетей заканчиваются, преждевременно. Владельцам генеративного ИИ и владельцам уникального цифрового контента есть, о чем договариваться. К тому же следует помнить, что в реальном мире остается много данных, которые еще не оцифрованы. Это живая речь людей в многочисленных аудиозаписях прошлых лет, библиотеки мира, архивы периодики на разных языках, произведения искусства, археологические находки.
Второе предубеждение – нейросети обучаются на абсолютно случайных данных, которые они вытягивают из интернета. Попробуем кратко объяснить, почему это не совсем так.
В машинном обучении есть важнейший термин датасет. Датасеты – это организованные наборы данных, которые используются для обучения и тестирования нейросетей. Как правило, они представляют из себя упорядоченные коллекции записей, каждая из которых содержит различные характеристики конкретного объекта.
Если ввести в поисковой строке Googleслово «датасет», то в выдаче будет много результатов с такими названиями: «130+ датасетов для машинного обучения», «Топ 100 open source датасетов», … В реальности доступных датасетов – десятки тысячи. Они различаются по назначению, содержанию и объему. Вот несколько примеров:
ImageNet– легенда, изменившая мир машинного обучения, которую мы уже упоминали. 14+ миллионов размеченных изображений в более чем 20 000 категорий.
MNIST– 70 000 рукописных цифр размером 28×28 пикселей.
Kinetics-700– 650 000 видеоклипов из YouTube, покрывающих 700 классов человеческих действий. Минимум 700 примеров на каждое действие — от занятий спортом до повседневной активности.
Отдельные датасеты можно найти для различных видов транспорта, одежды, обуви и мебели, фруктов, овощей и цветов, древнеегипетских иероглифов, деталей автомобилей, ситуаций на дороге, … Сложно придумать тему, для которой не найдется подготовленного датасета.
В интернете существует много открытых и закрытых коллекций датасетов. Например, американское правительство создало ресурс, который содержит тысячи датасетов от федеральных агентств по климату, здравоохранению, транспорту, экономике. Данные структурированы по регионам и уровням власти, что упрощает поиск. Есть коллекция датасетов на основе статистики здравоохранения от ВОЗ.
Для увеличения объема данных, которые можно использовать в обучении, часто применяется их аугментация – внесение незначительных изменений в реальные данные. Например, на фотографии человека меняется цвет глаз, форма носа, прическа. Измененные данные увеличивают объем обучающего набора, и при этом сохраняется связь с реальными данными.
Кроме датасетов, огромное значение для обучения нейросетей имеют синтетические данные. Так называют сгенерированные компьютером данные, похожие на настоящие, но при этом полностью выдуманные. Это не фотографии лиц реальных людей, а изображения лиц, нарисованные нейросетью. Это не истории болезни реальных людей, а придуманные истории вымышленных пациентов, похожие на настоящие. Это не портреты реальных покупателей, а похожие имитации с ФИО, которые берутся «с потолка».
Применение в обучении синтетических данных позволяет справиться с несколькими проблемами, которые плохо решаются или вообще не решаются при работе с реальными данными.
Дефицит и редкость данных. Например, нейросеть нужно научить диагностировать редкую болезнь. Реальных историй болезни – десяток, крайне мало для обучения. В таких случаях на помощь приходят синтетические данные, которые можно создать вручную или по заданным алгоритмам. Нейросеть учится на «выдуманных» данных и начинает лучше распознавать реальные.
Проблемы конфиденциальности. Законы о персональных данных ужесточаются во всех странах. Компании как огня боятся их утечки, и синтетические данные – то, что нужно в этой ситуации. Например, банк хочет сделать нейросеть, которая будет предсказывать, кто возьмет кредит и вернет, а кто – нет. Использовать для ее обучения реальные данные клиентов — опасно и незаконно. Поэтому создаются мифические кредитные истории «выдуманных» клиентов, похожие по статистике на настоящие истории. Для обучения нейросети подходит, сохранность персональных данных не нарушена.
Стоимость реальных данных. Например, чтобы обучить беспилотный автомобиль ездить по разным дорогам, нужно потратить много ресурсов на реальные тестовые поездки. Синтетические данные помогают сократить издержки. Создается виртуальная среда, в которой нейросеть автомобиля собирает синтетические данные с камер и датчиков и учится принимать правильные решения.
Дисбаланс реальных данных. В реальных данных один тип данных может присутствовать в избытке, а данных другого типа – явно недостаточно. Обучение на них будет однобоким и в итоге – ущербным. Синтетические данные помогают выравнивать такие дисбалансы.
Мусор в реальных данных. Как и сама жизнь, реальные данные – не идеальны. В них могут быть опечатки, ошибки, случайные помехи, которые мешают обучению нейросети. Синтетические данные могут быть очищены от этих помех.
Синтетические данные играют важную роль в машинном обучении, но всегда следует помнить об опасностях их чрезмерного или неуместного применения.
Синтетические данные могут быть недостаточно похожи на реальные. Например, человеческие лица, которые генерируют нейросети, как правило, идеальны и не имеют явных изъянов. Если нейросеть обучать только на таких лицах, она будет плохо распознавать реальные лица с морщинами, дефектами и разными оттенками кожи, плохим освещением.
Синтетические данные могут потерять важные нюансы реальных данных. Например, при разработке беспилотного наземного транспорта нужно учитывать все особенности погодных условий. Если забыть, например, про извилистую скользкую дорогу, в какой-то момент это станет катастрофическим недостатком.
Резюме. Подбор и/или подготовка специальных наборов данных для обучения нейросетей – это искусство в сочетании с высокой квалификацией. Да и потенциал накопленных человечеством неструктурированных данных далеко не исчерпан – генеративному ИИ есть, чему учиться.
Сюжет 12. Обучение, проверка и настройка
LLM
Я получил образование в библиотеке.
Совершенно бесплатно.
Рэй Брэдбери
Обучаться на структурированных наборах данных – датасетах – нейронные сети научились еще до революции генеративного ИИ. Такое обучение до сих пор играет важную роль, но революцию вызвали другие технологические решения. Их название сегодня слышали многие – большие языковые модели(Large Language Model, LLM).
LLMспособны «понимать» поступающий на вход текстовый запрос и адекватным образом реагировать на него. Эта их способность после выхода в свет ChatGPT3.5уже несколько лет будоражит умы людей. Для большинства такая способность LLM– таинство и повод говорить об искусственном разуме, к созданию которого наконец-то приблизилось любознательное человечество.
Будем разбираться, как обычно – «на пальцах».
Прежде чем LLMначнет на равных общаться с людьми, ее нужно этому обучить. Обучаются LLMна обычных человеческих текстах – книгах, публикация в СМИ, официальных документах, мнениях самых разных людей по самым разным поводам. Такое обучение предполагает, что LLMправильно воспринимает и интерпретирует поступающие на вход тексты, а результаты каждой интерпретации улучшают возможности LLMк последующему общению.
Прежде чем перейти к обучению LLM, перечислим некоторые проблемы, с которыми сталкиваются любые технологии обработки естественного человеческого языка. До недавнего времени решение этих проблем казалось невыполнимой задачей.
Проблемы и примеры будем приводить для русского языка.
Неоднозначные по смыслу фразы. Бытие определяет сознание. Что здесь что определяет на самом деле. Хочешь есть? Да нет, не знаю. Так «да», «нет» или «не знаю»?
Многозначные слова. Что ты думаешь об этом замке?А про что речь – про рыцарский замок или про дверной замок?
Фразеологизмы. Ни пуха, ни пера. У нас нет ни того, ни другого? Темная лошадка. А это лошадь какого цвета?
Отнесение местоимений к существительным. Мы составляли план праздника, потому что он… был очень нужен; … был очень близок.Без контекста невозможно определить, к чему относится местоимение «он».
Это лишь некоторые проблемы, которые подчеркивают сложность задачи понимания текстов. Тем не менее LLMнаучились справляться и с этими проблемами, и со многими другими, которые делают человеческий язык образным, богатым, эмоциональным.
Напомним, что в основе LLMлежат трансформеры – архитектура, которая пришла на смену RNN– рекуррентным нейросетям. RNNвоспринимают и обрабатывают текст последовательно – слово за словом. На больших текстах RNNработают плохо и неэффективно. Трансформеры способны воспринимать тексты целиком, сохраняя при восприятии заложенные в них смыслы и контекст.
LLMобучается на огромном количестве текстов. Обычно эти тексты делятся на три части. Первая используется непосредственно для обучения, вторая – для настройки параметров, третья – для итоговой проверки. Эти части не должны пересекаться, так как это завышает оценку качества работы LLM.
Сначала текст из первой части поступает в блок предварительной обработки, которая автоматически выполняется в несколько шагов.
На первом шаге текст разбивается на токены. Большинство токенов – это отдельные слова, но в целом ситуация сложнее и токенами могут быть неразделимые сочетания слов. Например, Нижний Новгород. Разбивать это название на два слова «нижний» и «Новгород» неправильно, так как в последующем приведет к искажениям. Таким образом, токены – это минимальные смысловые единицы.
Иногда токены объединяются в связанные последовательности, если в реальном языке соответствующие слова используются как устойчивые сочетания. Например, словосочетание «правильная дробь» целесообразно представить одним объектом для последующей обработки.
На втором шаге текст, разбитый на токены, нормализуется. Эта процедура предполагает переход к нижнему регистру, удаление знаков препинания, перевод в символьный вид всех чисел, расшифровку аббревиатур и некоторые другие операции.
На следующем шаге в словах-токенах выделяются корни путем устранения приставок, суффиксов, окончаний, они приводятся к канонической форме. Глаголы и его формы ставятся в неопределенную форму, существительные и прилагательные – в именительный падеж единственного числа. Слова «подумаю» и «думая» превращаются в слово «думать». Слова «веселенькие» и «празднички» в слова «веселый» и «праздник».
На последнем шаге подготовительного этапа проводится чистка текста – удаляются слова, которые не несут смысловой нагрузки: (артикли, междометья, союзы, предлоги).
После этого текст готов к переводу в его в числовые векторы и последующей обработке. Здесь начинается самая сложная для понимания часть процесса обучения LLM, за которой стоит математика, понятная и нужная специалистам по проектированию и обучению нейросетей. Для нас важно понять концептуальный смысл дальнейших действий, которые предпринимает LLM, формируя, поглощая и обрабатывая векторное представление подготовленного текста.
На первом шаге токены заменяются числами. Для замены используются заранее подготовленные переводные словари, в которых представлены пары «токен – число». Далее под токенами будем понимать их числовые представления.
Для дальнейшего погружения еще раз обратимся к архитектуре трансформеров, которая лежит в основе работы LLM. Важнейшим ее элементом является механизм внимания(attention). Этот механизм заменяет в LLMмеханизм понимания, который лежит в основе человеческого мышления.
Как и почему человек понимает текст и все его контекстные нюансы – до сих пор большая загадка. Во многом понимание человека интуитивно, не предсказуемо и вряд ли представимо в виде строгой математической модели. Механизм внимания LLM– это не метафора, не интуиция, а строгий математический аппарат. В результате его применения LLMвеликолепно имитирует важнейшую когнитивную способность человека – понимание речи.
С помощью механизма внимания LLMопределяет, какие токены входного текста наиболее значимы в конкретной ситуации. LLMне фиксирует последовательность токенов, а вычисляет, какие из них связаны между собой и насколько. Каждый токен сопоставляется с каждым, независимо от их положения в тексте. По результатам сопоставления формируется матрица весов, которая отражает степень значимости каждой пары токенов по отношению друг к другу.
Черный кот залез на черепичную крышу дома.
После применения механизма внимания к этому предложению, слова «кот» и «крыша», «кот» и «черный» оказываются в многомерном векторном пространстве ближе друг к другу, чем слова «кот» и «черепичный». Эта близость выражена строгими математическими отношениями (параметрами нейросети), которые можно использовать для дальнейшей работы».
По мере обработки различных текстов, векторное пространство расширяется и уточняется. Если про черного кота LLMузнала не из одного текста, а из многих, близость слов «кот» и «черный» будет зафиксирована в результатах обучения LLMболее прочно.
Естественный язык многогранен. Слова в предложениях и тексте связаны не только по смыслу, но и по синтаксису, позиции, ассоциациям, стилистике, концепциям.
Черный кот, живущий на крыше дома, напоминает не животное, а трубочиста.
Слова «черный» и «кот», «черный» и «напомнить» – связь смысловая и синтаксическая, так как это словосочетания. Слова «кот» и «трубочист» – связь ассоциативная. Слова «кот» и «животное» – связь концептуальная.
Поэтому в LLMиспользуется механизм множественных голов внимания(multi-head attention). Каждая «голова» – это независимый блок внимания, обучающийся видеть определённый вид связей и вычислять соответствующие им весовые параметры. Так формируется сложная многослойная структура внимания, где LLMодновременно смотрит на текст под разными углами. Это делает его восприятие более точным и гибким, а внутреннее представление текста – многомерным.
Результатом всей процедуры является многомерная матрица внимания, в которой каждому слову присвоены веса, показывающие его важность для всех остальных слов по разным видам связей.
А теперь представим себе, какое количество связанных данных должно храниться в многомерном векторном пространстве после того, как LLM«прочитает» тысячи книг и сотни тысяч публикаций. Именно поэтому для больших языковых моделей понадобились нейросети с миллиардами параметров и огромные вычислительные мощности.
На этапе предварительного обучения LLM«проглатывает» огромное количество книг и публикаций, представляющих разные грани человеческого творчества – от юмористических рассказов до научных отчетов, от коротких новостных сообщений до романов. Обработать поступающие на вход тексты – первая задача LLM. Вторая задача – генерировать связанный текст в ответ на запросы пользователей.
Когда LLMгенерирует текст, она не думает и не выбирает в человеческом смысле. У нее нет интуиции, воли или намерения. Есть только математическая структура, в которой каждое возможное слово имеет свои веса, зависящие от контекста. И есть стратегия генерации, которая формирует последовательность слов. Каждое следующее слово подбирается с учетом четырех основных факторов:
первый фактор– математическая структура поступившего на вход запроса пользователя;
второй фактор– математическая структура, сформированная на этапе предварительного обучения;
третий фактор– вероятностные алгоритмы, позволяющие подбирать наиболее подходящие слова (если в запросе есть слова «лаять» и «кусать», наиболее вероятное слово для подбора – «собака»);
четвертый фактор– сформированная до этого последовательность слов в ответе.
Вероятностные алгоритмы могут быть настроены разными способами. Можно использовать очевидное правило «подбирать слова в лоб, с самой высокой совокупной вероятностью».
Солнце взошло над…
Вероятность токена «море» – 0.45, токена «город» – 0.30, токена «стакан» – 0.001. Модель не задумываясь выбирает токен «море». Текст получается предсказуемым и … скучным. Если вероятностные алгоритмы настроить более тонко, можно получить красивую литературную фразу.
Солнце взошло над прекрасным просыпающимся городом.
После предварительного обучения LLMпроводится ее проверка, отладка и экспертная настройка.
В ходе проверки LLMполучает от экспертов тестовые задания, затем эксперты оценивают качество их выполнения. У первых LLMэкспертами выступали люди. В настоящее время все чаще в качестве экспертов используют другие LLM(об этом – в следующем сюжете).
Если в процессе проверки выясняется, что в работе LLMесть недостатки или пробелы, проводится ее отладка – LLMобучается на дополнительных текстах. Их подбирают таким образом, чтобы LLMпосле их обработки избавилась от выявленных недостатков.
Экспертная настройка – это проверка LLMна соответствие человеческой этике и внесение в нее соответствующих ограничений. Такая настройка, например, запрещает LLMдавать советы по приготовлению взрывчатых веществ, обсуждать детскую порнографию, рассказывать о наркотиках. Перекосы в экспертной настройке могут усиливать галлюцинации LLM(о этом поговорим в одном из следующих сюжетов).
Резюме. Большие языковые модели – LLM– не умеют думать, как человек. Но гениальные идеи и мощный математический аппарат научили их великолепно имитировать важнейшие когнитивные способности человека – понимание текстов и ведение осмысленного разговора на естественном языке.
Сюжет 13. Варианты дополнительного обучения
LLM
Учиться, учиться и учиться.
Владимир Ленин
Универсальная LLMобучена, проверена, отлажена и настроена. Модель выпускают в мир, и начинается ее эксплуатация. Пользователи в восторге, некоторые даже готовы платить за это деньги. Однако в ходе работы с LLMпостепенно вырисовываются несколько проблем.
Проблема первая– LLMделает разного рода ошибки. Не может посчитать количество букв R в слове STRAWBERRY. Ошибается в перемножении трехзначных чисел. Не понимает родовидовые отношения между понятиями. Не может решить несложные логические задачи, например, из тестов IQ. Перечень можно продолжать.
Проблема вторая– не хватает актуальных данных. В мире постоянно происходят новые события в самых разных сферах человеческой деятельности. Об этих событиях появляются многочисленные публикации в прессе. LLMоб этих публикациях не знает, в ее математической структуре они не учтены.
Проблема третья– не хватает специальных знаний. Когда универсальной LLMначинают давать задания, требующие глубоких специальных знаний, она может путаться, упрощать или вообще фальсифицировать ответы.
Проблема четвертая– стиль ответов LLMне соответствует задаче. Чат-боту, который обслуживает клиентов, нужно повысить уровень вежливости в диалогах. Чат-бот, который играет роль приятеля, должен общаться непринужденно и даже где-то фамильярно.
Проблема пятая– не хватает индивидуальных данных. Человеку часто хочется получать ответы на вопросы, учитывающие его индивидуальные предпочтения. Например, только ту информацию о каком-то событии или явлении, которую он считает важной (важной именно для себя).
Каждая проблема по отдельности и уж тем более все они в совокупности – это повод для разработчиков LLMследовать завету вождя большевиков, вынесенному в эпиграф сюжета.
Здесь важно отметить два обстоятельства.
Во-первых, LLM– это сложнейшая программная система. Как любая сложная программная система она не может обновляться по щелчку пальцев – нашли недостаток, тут же его устранили и систему обновили. Так в ИТ-отрасли не делается для любых сложных систем.
Недостатки выявляются, систематизируются, накапливаются, постепенно исправляются, работоспособность системы повторно тестируется. В какой-то момент этот цикл приостанавливается. Новая версия системы с исправленными недостатками обновляется и становится доступной пользователям.
Точно так же разработчики дорабатывают и развивают свои LLM– периодически выпускают новые версии, которые существенно превосходят предыдущие. Периодичность – это не дни, а месяцы.
Во-вторых, перечисленные проблемы имеют разную природу и требуют совершенно разных подходов для решения. Об этих подходах дальше и будем говорить.
Устранение ошибок в работе LLM. Это самая скрытая от широкой публики работа создателей больших языковых моделей. Какие-то проблемы решаются понятными способами. Для каких-то проблем разработчики придумывают тайные алгоритмы и подходы, о которых можно только догадываться.







