
Полная версия
Цифра и мы. Истории о нашем прошлом, настоящем и будущем
Все это в каждом отдельном человеке намешивается в индивидуальный коктейль устремлений. Но всегда проявляются доминирующие устремления, которые и нужно учитывать.
Выделим типажи людей, соответствующие группы и их роль в обществе будущего. Повторим, что принадлежность к группе – не данность на все времена. У людей по мере развития меняются устремления, поэтому между группами не должно быть жестких границ.
Противники. Люди, которые отказались признавать установленные человечеством правила, целенаправленно нарушающие законы. Лишены базового дохода, подвергаются преследованиям и наказанию в зависимости от степени правонарушений.
Иждивенцы. Люди, которым для жизни достаточно базового дохода и базового набора развлечений, которые готово предоставить общество. Они не приносят человечеству вреда. Но их сознательный выбор – отказ приносить человечеству пользу. Они лишаются большинства гражданских прав, но базовые потребности общество удовлетворяет. Искусственный интеллелкт и автоматизация большинства экономических процессов позволят это обеспечить.
Труженики. Это самая массовая группа, обладающая базовыми гражданскими правами. Такие люди честно работают в разных сферах человеческой деятельности. Официально декларируемый мотив – улучшение материального благосостояния (своего, своей семьи). Претензий и прав на занятие элитных мест в обществе нет.
Предприниматели. Люди, которые развивают собственное дело. Главная мотивация – сочетание самореализации в бизнесе, принесение общественной пользы и существенное повышение собственного материального благосостояния. Власть осуществляет инвестиционную поддержку перспективных начинаний. Жесткий прогрессивный подоходный налог, ограничения монополизации рынка. В верхние эшелоны власти предприниматели не допускаются.
Служилые. Люди, которые заявили о готовности служить человечеству. Материальное благосостояние для них вторично. Работают в самых разных сферах. Получают от государства установленный уровень материальных благ. Имеют право занимать должности из специального реестра: аудиторы, воспитатели, военнослужащие…
Ученые. Люди, которые желают работать на научном поприще. Главная мотивация – потребность в познании. Согласны соблюдать принятые этические нормы. Работают в научных центрах в рамках единого управляемого научного пространства Земли. Получают от государства установленный уровень материальных благ. Люди, которые занимаются наукой с целью повышения материального благосостояния, относятся к труженикам.
Творцы. Творческие люди, которые готовы служить человечеству на культурном поприще. Главная мотивация – творческая самореализация. Согласны соблюдать принятые этические нормы. Работают индивидуально или в творческих коллективах. Получают от государства установленный уровень материальных благ. Люди, которые занимаются творчеством для повышения материального благосостояния, относятся к труженикам. Творцы, отказывающиеся соблюдать принятые этические нормы, – это противники.
Пастыри. Люди, которые встали на путь духовных исканий и служения в рамках не запрещенных религий и религиозных течений. Получают от государства установленный уровень материальных благ.
Элита. Люди, которые занимают ключевые должности, связанные с принятием важных управленческих решений, распределением материальных ресурсов, выработкой и соблюдением законов. Получают от государства установленный уровень материальных благ. Жесткие требования к жизненным ценностям, в том числе обязательная проверка их правдивости. Жесткий контроль материального благосостояния.
Еще раз отметим. Предлагаемая модель – это только повод задуматься и начать дискуссию в обществе. Дискуссия назрела. Время ускоряется, где обрыв в пропасть неизвестно. Потом мы просто не успеем рассмотреть все возможности для выхода из тупиков.
10 историй из книги «Цифра и интеллект»
ИИ-революция 2022 года взорвала привычный нам мир. То, что казалось незыблемым, сегодня подвергается сомнениям. ИИ меняет жизнь людей, организаций, стран. ИИ меняет жизнь нашей цивилизации. Чтобы адаптироваться к этим изменениям, мало научиться вести диалоги с популярными ИИ-моделями. Нужно понимать возможности и перспективы, риски и угрозы, которые несет людям их новое творение. Книга поможет разобраться с главными вопросами и проблемами, которые ставит ИИ-революция.
В книге "Цифра и интеллект" 50 отдельных историй.
Познакомьтесь с 10 историями. Каждая – это повод задуматься.
История становления ИИ: надежды и сложности

Все, что делается в мире,
делается с надеждой.
Мартин Лютер
В этом сюжете мы рассмотрим историю становления ИИ как нового научного направления. Также будем говорить о символическом ИИ, оставляя для следующего сюжета историю развития нейросетей. В то же время искусственный интеллект как научное направление объединяет символический ИИ и нейросети. Это понятно и естественно, так как главная цель общая – воссоздание искусственным путем человеческого интеллекта. При помощи каких технологий – не так важно.
История искусственного интеллекта (ИИ) как нового научного направления начинается в середине XX века. К этому времени для работ над ИИ сложился ряд предпосылок. Среди философов давно шли споры о природе разума человека и процессе познания мира. Нейрофизиологи и психологи разработали ряд теорий о работе человеческого мозга и мышления. Экономисты и математики занимались оптимизацией расчётов и представлением знаний о мире в формализованном виде. Зародилась теория алгоритмов. Были созданы первые компьютеры.
Скорости вычислений ЭВМ оказались больше человеческих. В учёном сообществе закономерно начались дискуссии о границах возможностей компьютеров. Сразу возник вопрос: «Способны ли вычислительные машины достигнуть уровня развития человека?» Искусственный интеллект, который сравним с человеческим, стали называть сильным ИИ. Если техническое решение способно было решать отдельные задачи, присущие человеку, его стали называть слабым ИИ.
В 1950 году один из пионеров в области вычислительной техники, английский учёный Алан Тьюринг, пишет статью под названием «Может ли машина мыслить?» Это было, наверное, первое детальное исследование вопроса, могут ли машины думать. Единого и общепринятого ответа на вопрос «что значит – думать?» на тот момент не было. Поэтому, чтобы не погрязнуть в сложнейших философских и психологических концепциях, Тьюринг предлагает изящное решение.
Он описывает процедуру, получившую название тест Тьюринга. Человек и машина беседуют, а другой человек наблюдает за содержанием беседы. Если наблюдатель не может с уверенностью сказать, что сказал человек, а что машина, тест пройден и машину можно назвать сильным ИИ.
В другом варианте теста Тьюринга человек общается с неизвестным собеседником, которым может быть и человек, и машина. Если он не может их различить, то тест пройден, и машина – сильный ИИ.
До недавнего времени считалось, что тест Тьюринга позволит определить момент, когда машина в плане разумности сравняется с человеком. Генеративные нейросети опровергли применимость теста Тьюринга для ответа на заданный в статье вопрос.
Считается, что искусственный интеллект как научное направление появилось во время двухмесячного научного семинара, проведённого летом 1956 года в Дартмутском колледже, в Великобритании. В семинаре приняли участие ведущие западные ученые в области информатики – Джон Маккарти, Марвин Минский, Клод Шенон, Герберт Саймон и другие – всего 11 человек. Всех приглашенных объединял интерес к вопросам моделирования человеческого разума.
В организационных документах семинара заявлялось:
Мы предлагаем исследование искусственного интеллекта сроком в 2 месяца ... Исследование основано на предположении, что всякий аспект обучения или любое другое свойство интеллекта может в принципе быть столь точно описано, что машина сможет его симулировать. Мы попытаемся понять, как обучить машины использовать естественные языки, формировать абстракции и концепции, решать задачи, сейчас подвластные только людям, и улучшать самих себя.
Дартмутский семинар стал ключевой вехой в становлении новой научной области. Были утверждены ее основные положения, направления исследований, принципы и подходы. По предложению Джона Маккарти она получила название – artificial intelligence (AI), или в русском языке – искусственный интеллект (ИИ).
Особое внимание на семинаре было уделено нейросетям. Один из основных принципов создания искусственного интеллекта предполагал меняющиеся ответы на переменную среду. Его реализация требовала обучения машины методом проб и ошибок на произвольных данных – по аналогии с работой нейронной сети человеческого мозга.
Этим принципом отцы-основатели заложили мину под символический ИИ. Обучаться методом проб и ошибок на произвольных данных он в принципе не умел. Возможно, поэтому в дальнейшем решения, основанные на символическом ИИ, чаще называли интеллектуальными информационными системами или системами с интеллектуальным интерфейсом, избегая термина искусственный интеллект.
Любопытное совпадение – 11 сентября 1956 года в Массачусетском технологическом институте собралась специальная группа ученых, занимавшихся науками, смежными с теорией информации. Среди присутствующих были Герберт Саймон, Аллен Ньюэлл, Ноам Хомский. Все трое занимались искусственным интеллектом. Первый – на стыке с экономикой, второй – на стыке с психологией, третий – на стыке с лингвистикой. Саймон и Ньюэлл летом того же года принимали участие в Дартмутском семинаре.
Считается, что встреча в МТИ сформировала еще одно новое научное направление – когнитивную психологию. Этот раздел психологии исследует познавательные процессы человека: восприятие, память, внимание, представление и обработку информации, логическое, критическое и системное мышление, воображение и творчество, принятие решений. Выводы когнитивной психологии широко используются в других науках – в социологии, педагогике, экономике, а также при проектировании и построении систем искусственного интеллекта.
Когнитивная психология способствовала формированию нового направления в экономике – поведенческой экономике. Герберт Саймон – американский ученый с широкими интересами, считается одним из основателей научного направления искусственный интеллект. По совместительству он – лауреат премии имени Нобеля по экономике, которого иногда называют отцом поведенческой экономики. Вот такие научные переплетения.
Так получилось, что после знакового Дартмутского семинара действительность стала расходиться с наполеоновскими научными планами. Нейросети, которые в теории обладали гигантским потенциалом, дальше забавных экспериментов не продвинулись. Вопреки первоначальным планам символический ИИ стал доминирующей парадигмой исследований с середины 1950-х до конца 1980-х.
Символический ИИ – это собирательное название для всех технологий искусственного интеллекта, основанных на высокоуровневом «символическом» представлении задач и вопросов, логики их обработки, поиска решений и ответов.
В 1956 году Герберт Саймон и Аллен Ньюэлл представили миру компьютерную программу «Логик-теоретик». Это была первая программа, специально разработанная для выполнения автоматизированного логического вывода, которую называют «первой программой искусственного интеллекта». Программа была предназначена для доказательства математических теорем.
Программе удалось доказать 38 из 52 теорем, изложенных во второй главе трехтомника «Принципы математики», одним из авторов которого был знаменитый Бертран Рассел. Машинное доказательство одной теорем оказалось более изящным, чем доказательство авторов трехтомника.
Герберт Саймон сумел показать новое доказательство Бертрану Расселу и, по словам очевидцев, тот «с восторгом отреагировал». Правда, попытка опубликовать новое доказательство в научном журнале, посвященном вопросам логики, провалилась Редакция его отвергла под предлогом, что доказательство элементарной математической теоремы не представляет особой ценности. Это говорит о том, что исследованиям в области ИИ в 1950-е годы значения не придавали.
В 1966 году общественности был представлен первый в истории чат-бот по имени «Элиза». Эта программа формировала ответы по ключевым словам, которые встречались в вопросе. Хитрые алгоритмы позволяли чат-боту походить на психотерапевта. В США визиты к «Элизе» стали весьма популярными, поскольку люди поражались убедительности реплик и принимали её за искусственный разум.
Это конечно не было прорывом, и при внимательном диалоге «Элиза» быстро показывала свою ограниченность. Однако ее появление подогрело интерес к обработке естественного языка как функции искусственного интеллекта. Главное – показанные возможности заинтересовали большие компании, а также DARPA – управление перспективных исследовательских разработок Министерства обороны США.
Тем не менее кризис надвигался. Он был связан даже не столько с небольшими успехами нового научного направления, сколько с неоправданными завышенными ожиданиями. После Дартмутской конференции учёные-энтузиасты увлеченно предсказывали, что в ближайшем будущем появятся умные машины с сильным ИИ. Однако компьютерные технологии не могли угнаться за фантазиями учёных и футурологов. Успехи «Логика-теоретика» и подобных систем с практической точки зрения представлялись незначительными, а популярность «Элизы» – недолговечной.
Интерес к ИИ начал падать, и к середине 1970-х годов финансирование ИИ-исследований свелось к минимуму. Этот период иногда называют первой зимой искусственного интеллекта.
Зима продлилась несколько лет. С 1980-х годов начался бум экспертных систем, которые являются частным случаем символического ИИ. Бум был вызван не научными прорывами, а практической пользой, которую наконец стали приносить технологии ИИ.
Экспертные системы предназначались для выполнения специализированных задач. По сути, они имитировали работу профессионалов, помогая принимать решения в конкретных сферах деятельности. Экспертные системы состояли из двух ключевых компонентов:
базы знаний в виде набора фактов и правил, собранных силами экспертов;
алгоритмов, которые на основе сопоставления поступающих запросов с базой знаний проводили анализ и предлагали решения.
Одна из самых известных экспертных систем была разработана для компьютерной корпорации DEC. Она помогала инженерам настраивать серверы, экономя миллионы долларов ежегодно.
Экспертные системы стали широко применяться в различных областях, включая медицину, инженерное дело и финансы. Они позволяли автоматизировать процессы принятия решений и улучшать точность и эффективность работы специалистов.
Экспертные системы доказали свою полезность в узких областях, где процессы можно было описать строгими правилами. Однако, несмотря на успехи, они имели существенные ограничения и не могли справляться с задачами, требующими гибкости и адаптации.
Увлечение некоторых ученых новым научным направлением понятно. Создание сильного ИИ – самая завораживающая исследовательская проблема. Но история развития технологий ИИ интересна еще одним аспектом – отношением к этой теме массового обывателя.
Ажиотаж вокруг темы, подогретый знаменитыми учеными в середине 1950- годов, длился недолго и перекочевал на страницы научно-фантастических произведений. Интерес обывателей к реальным результатам исследований в области ИИ также угас очень быстро.
Системы распознавания образов, построенные на сложнейшем математическом аппарате, давали слишком много ошибок. Программы, способные делать логические выводы и решать задачи в рамках некоторой системы аксиом и правил вывода, оказались чрезвычайно громоздкими. Да и программная система, способная доказывать математические теоремы, в золотой век капитализма послевоенной эпохи мало кого могла заинтересовать.
Всплеск массового интереса к «Элизе» быстро сменился разочарованием и еще большим отстранением от темы. Узкие экспертные системы интересовали в основном узких профессионалов, обсуждать их для обывателей было сложно и не интересно.
Людей волновал один вопрос – когда компьютер обыграет в шахматы чемпиона мира. В 1997 году компьютер Deep Blue в шести партиях победил Гарри Каспарова. Массовый интерес к ИИ угас окончательно. Все остальные успехи нового научного направления, вплоть до революции генеративного ИИ 2022 года, связаны с нейросетями.
Резюме. В самом начале отцы-основатели сделали правильное предположение: полноценный ИИ можно создать только на основе технологий, работающих по аналогии с нейронной сетью человеческого мозга. Дальнейшая история подтвердила эту гипотезу.
Данные, которые используют для обучения

Дети учатся на примере взрослого,
а не на его словах.
Карл Юнг
Практически любой человек знает или хотя бы слышал, что генеративный ИИ обучается на больших массивах данных. Относительно этих массивов существует два предубеждения, широко распространенных среди людей, не представляющих, что такое машинное обучение. Это люди, которые уже активно используют генеративный ИИ, а также люди, которые к нему только присматриваются.
Первое предубеждение – для обучения нейросетей уже использованы все данные, накопленные человечеством. Второе предубеждение – нейросети обучаются на абсолютно случайных данных, которые они вытягивают из интернета.
Разбираться с машинным обучением – удел квалифицированных специалистов. Но нынешним и будущим пользователям генеративного ИИ с предубеждениями лучше расстаться. Попробуем им в этом помочь. А заодно поговорим о том, как находятся, отбираются и готовятся данные для обучения самых разных моделей современного искусственного интеллекта.
Начнем с первого предубеждения.
С 2024 года в самых разных изданиях, в том числе весьма авторитетных, постоянно появляются публикации примерно с такими заголовками: «Данные для обучения нейросетей заканчиваются. Что дальше?» В подтверждение приводится, например, такое сообщение:
Осенью 2024 разработчики OpenAI обнаружили, что, несмотря на общий рост производительности самой последней языковой модели, прогресс при переходе на нее менее заметен, чем при переходе от ChatGPT-3 к ChatGPT-4. Они связывают это с тем, что модель обучили уже на всех легкодоступных данных.
Читатель, уверены, уже отметил, что ключевое слово здесь «легкодоступные», а не слово «все». И это действительно так – заканчиваются легкодоступные данные, которыми могут пользоваться разработчики генеративного ИИ. Но, значит, есть еще и труднодоступные данные?
Здесь придется сделать небольшой экскурс во всемирную паутину.
Мы так часто употребляем слова «интернет», «всемирная паутина», «глобальная сеть», что в нашем сознании само понятие интернет ассоциируется с огромным, но единым информационным пространством. Мы почему-то уверены, что можем найти в интернете все.
Не все, что пожелаем, но точно – все, что там есть. В интернете, скорее всего, нет описания и изображения семирукого шестинога. Но если есть, их можно получить, составив правильный поисковый запрос – не правда ли? В реальности – все не совсем так.
В интернете принято выделять три сегмента.
Видимый интернет (Surface Web). Это тот сегмент интернета, к которому мы получаем доступ при помощи ссылок и поисковых запросов. В нем расположены официальные сайты организаций, новостные порталы, интернет-издания и многого другое, что находится в открытом доступе. Этот сегмент интернета доступен поисковым роботам, которые постоянно индексируют веб-страницы. Google и другие поисковые системы выдают в качестве результата только то, что находится в видимом сегменте интернета.
Глубокий интернет (Deep Web). Этот сегмент иногда называют «скрытая сеть», «невидимая сеть». Это места или контент в интернете, к которым нельзя получить доступ с помощью обычных поисковых систем. В первую очередь, это веб-страницы и базы данных, для доступа к которым нужно пройти аутентификацию, например, ввести логин и пароль. Так владельцы контента ограничивают к нему доступ.
Ограничение доступа к цифровому контенту может быть обусловлено многими причинами. Защитой персональных данных, конфиденциальностью контента, желанием на нем заработать.
Темный интернет (Dark Web). Более распространен термин даркнет. Это совсем небольшой сегмент интернета, для доступа к которому нужны специальные программные средства (обычные браузеры его не видят). В этом сегменте основная часть контента связана с преступной деятельностью. Искать читателю этот сегмент интернета мы категорически не рекомендуем, так как незаметно преступить закон в темном интернет проще простого.
Когда сравнивают сегменты видимого и глубокого интернета, обычно используют аналогию с айсбергом. Видимый интернет – это малая часть информационного айсберга. Глубокий интернет – его основная, гораздо более массивная часть. По некоторым оценкам глубокий интернет содержит более 90% цифровых данных. Оценки разнятся, но в любом случае закрытый цифровой контент в разы превосходит контент открытый.
Понятно, что учиться на данных из глубокого интернета генеративный ИИ в общем случае не может. Конечно, создатели ИИ-модели могут купить закрытый цифровой контент у его владельцев. В некоторых случаях владельцы свой контент и закрывают, чтобы зарабатывать на доступе к нему. Однако общей ситуации это не меняет – огромное количество закрытых данных для обучения нейросетей недоступно.
Да и с открытыми данными в видимом сегменте все не так просто.
С 2008 года некоммерческая организация Common Crawl занимается сканированием видимого сегмента интернета и созданием его обширного архива. Результаты своей работы организация бесплатно предоставляет широкой общественности. На ноябрь 2024 года в архивах организации хранилось около 250 миллиардов страниц, 45% которых – на английском языке.
До революции генеративного ИИ деятельность организации особых возражений не вызывала. Платный контент находился в закрытом сегменте интернета, а если попадал в видимый сегмент, Common Crowl была не при чем – это были происки пиратов.
Все изменилось, когда архивы Common Crowl стали использовать для обучения своих нейросетей компании, ведущие разработку в области генеративного ИИ. Быстро выяснилось, что в архивах хранятся миллионы платных публикаций, принадлежащих крупнейшим изданиям, таким как The New York Times, The Wall Street Journal и другие.
Поисковые роботы Common Crowl, как и поисковые роботы Google, умели извлекать платные публикации, пользуясь некоторыми скрытыми возможностями новостных лент. Но от поисковых инструментов Google владельцы контента признавали пользу – они увеличивали поток пользователей на их ресурсы. А вот пользы от того, что их публикации служат для обучения генеративного ИИ, владельцы не видели. Более того, уникальные возможности по генерации текстов делают искусственный интеллект серьезным конкурентом для периодических изданий и новостных агрегаторов.
Сегодня многие крупнейшие информационные ресурсы блокируют программы, которые собирают данные для обучения нейросетей. Среди них New York Times, Reuters и CNN. Поэтому пока генеративному ИИ сложно конкурировать на рынке оперативной достоверной информации. Давать объективную оценку событиям, которые произошли на днях, он не может.
Говорить, что данные для обучения нейросетей заканчиваются, преждевременно. Владельцам генеративного ИИ и владельцам уникального цифрового контента есть, о чем договариваться. К тому же следует помнить, что в реальном мире остается много данных, которые еще не оцифрованы. Это живая речь людей в многочисленных аудиозаписях прошлых лет, библиотеки мира, архивы периодики на разных языках, произведения искусства, археологические находки.







