Сплетая разум. Нейросети и будущее
Сплетая разум. Нейросети и будущее

Полная версия

Сплетая разум. Нейросети и будущее

Язык: Русский
Год издания: 2026
Добавлена:
Настройки чтения
Размер шрифта
Высота строк
Поля
На страницу:
2 из 2

К концу 1990-х годов модификации LeNet, внедрённые в банкоматы и сортировочные машины, обрабатывали, по разным оценкам, от 10 до 20 процентов всех банковских чеков в Соединённых Штатах. Это были миллиарды долларов, сэкономленных на ручном труде. Свёрточная нейронная сеть, сама того не ведая, стала одним из крупнейших «белых воротничков» в финансовой системе. Но парадокс в том, что мир не кричал о революции. Никто не выносил Лекуна на обложки. Всё это работало тихо, под капотом, как какой-нибудь неприметный, но очень полезный контроллер. Это была победа, но победа локальная. Триумф нейросетей, загнанный в рамки одной конкретной, утилитарной задачи. Для того чтобы CNN, да и все остальные сети, совершили тот самый прыжок, который мы называем «Большим взрывом», нужны были ещё два компонента. Первый — океан данных. Не тысячи, а миллионы и миллионы размеченных примеров. И второй — чудовищная, немыслимая по тем временам вычислительная мощь.


Ирония судьбы в том, что и то, и другое человечество создало во многом ради развлечения. Данные породил интернет, заполнив фотографиями, текстами и видео каждый его уголок. А мощь пришла из индустрии компьютерных игр. Видеокарты (GPU), созданные для того, чтобы просчитывать миллионы полигонов в шутерах от первого лица, оказались идеальными машинами для расчёта миллионов нейронных связей. Оставался последний шаг: нужен был человек, который объединит эти три компонента — глубокую архитектуру, гигантский датасет и мощь GPU — в одном эксперименте. Этот человек уже учился в университете, и его звали Алекс Крижевский. Но прежде чем он вышел на сцену, одна блестящая женщина-учёный должна была создать тот самый «Эверест», который он покорит. Её звали Фей-Фей Ли.


Глава 5. Глаза для машин: Фей-Фей Ли, ImageNet и дар геймеров


Представь себе ребёнка, который учится говорить и распознавать предметы. Он не получает словарного определения каждой вещи с первого раза. Вместо этого родители и весь окружающий мир терпеливо, год за годом, показывают ему бесчисленное множество примеров. «Это кошка. И это кошка. А это, видишь, уже собака. Нет, это всё ещё кошка, просто пушистая и лежит в коробке». К тому моменту, когда ребёнок идёт в детский сад, его мозг обработал астрономическое количество визуальных образов, каждый из которых был снабжён ярлыком: словом, звуком, тактильным ощущением. Именно эта гигантская, размеченная реальностью выборка и создаёт фундамент человеческого интеллекта.


До середины 2000-х годов у компьютерного зрения такой выборки не было. Алгоритмы мучили на крошечных, игрушечных наборах данных. Самый популярный из них, Caltech-101, содержал чуть более 9000 изображений, разбитых на 101 категорию. Тысячи изображений! Этого катастрофически мало, чтобы охватить бесконечное разнообразие реального мира — ракурсов, освещения, окрасок, фона. Сети, обученные на такой скудной диете, были близорукими и хрупкими. Они ломались, столкнувшись с реальной фотографией, сделанной под непривычным углом. Нужен был прорыв в данных. И этот прорыв совершила женщина, которая изначально вовсе не собиралась заниматься компьютерами.


Фей-Фей Ли родилась в Пекине, а в 16 лет переехала с семьёй в США. Её родители, принадлежавшие в Китае к интеллигенции, в Америке работали официантами и продавцами, чтобы дать дочери образование. Она хотела стать физиком, увлекалась тайнами Вселенной. Но однажды, наблюдая за своим ребёнком, она задумалась о чуде человеческого восприятия. Малыш смотрел на мир широко раскрытыми глазами и, казалось, впитывал его без всяких усилий. Как? Как из потока фотонов, падающих на сетчатку, рождается понимание «это стул, на него можно сесть»? Этот вопрос заворожил её и привёл в область компьютерного зрения.


К середине 2000-х Фей-Фей Ли была уже профессором. И она выдвинула идею, которая поначалу показалась коллегам безумием, прожектёрством, достойным Дон Кихота. Она предложила создать базу данных из миллионов изображений, охватывающую не сотни, а тысячи и десятки тысяч категорий объектов. Всех. Не только «кошки» и «собаки», но и «каноэ», «скрипки», «закаты», «улыбки», «текстуры ржавого металла» — всё богатство видимого мира. Причём каждое изображение должно быть размечено вручную живым человеком.


Её отговаривали. Гранты не давали. «Вы с ума сошли, — говорили маститые профессора. — Вам понадобится целая армия дешёвой рабочей силы, годы труда и миллионы долларов. Это технически невозможно». Но Фей-Фей Ли верила в свою идею с упорством, которое бывает только у людей, пересёкших океан и начавших жизнь с нуля. Она понимала то, что позже станет аксиомой: данные — это топливо для алгоритмов. Без топлива самый совершенный двигатель — просто груда металла.


И здесь случилось чудо, имя которому — краудсорсинг. Как раз в это время набирал силу Amazon Mechanical Turk — онлайн-платформа, позволявшая нанимать сотни тысяч людей по всему миру для выполнения крошечных, простых заданий за копейки. Это и была та самая армия. Фей-Фей Ли и её команда наняли этих «цифровых рабочих» и поставили перед ними простую задачу: смотреть на картинки и говорить, что на них изображено.


Процесс был титаническим. Нужно было не просто собрать фотографии из поисковиков. Их требовалось очистить, проверить, привести к единому стандарту. А затем — разметить. Не один раз, а многократно, для перепроверки. Десятки тысяч анонимных людей в разных часовых поясах годами сидели перед мониторами и кликали: «автомобиль», «дерево», «лицо», «подушка», «водопад». Так, крупица за крупицей, рождалась ImageNet.


К 2009 году работа была завершена. Результат превзошёл самые смелые ожидания. ImageNet содержал более 14 миллионов изображений, аккуратно рассортированных по 21 841 категории. Это был Эверест данных. Цифровой Ноев ковчег, в котором имелось по паре каждого визуального существа и явления. Но, как это часто бывает с великими творениями, поначалу его никто не оценил. На ведущей конференции по компьютерному зрению CVPR доклад Фей-Фей Ли приняли, но выделили ей лишь скромную постерную сессию, а не устный доклад. Эверест стоял, но желающих его штурмовать пока не находилось.


Нужно было превратить каталог в соревнование. Фей-Фей Ли и её коллеги объявили о запуске ImageNet Large Scale Visual Recognition Challenge (ILSVRC) — ежегодного конкурса, где лучшие алгоритмы мира будут сражаться за точность распознавания на её гигантском датасете. И чтобы подогреть интерес, они выделили подмножество из 1,2 миллиона изображений и 1000 тщательно отобранных категорий. Это был вызов. Приз, манивший лучших гладиаторов мира ИИ.


Оставалась одна проблема: вычислительная мощь. CNN Лекуна были хороши, но на ImageNet они захлебнулись бы. Обучать глубокие сети на миллионах картинок на обычных процессорах (CPU) было всё равно что пытаться выкопать Панамский канал лопатой. Теоретически можно, но займёт годы или десятилетия. И тут своё слово сказала индустрия, которая меньше всего думала о науке. Индустрия компьютерных игр.


Пока учёные бились над распознаванием кошек, геймеры по всему миру требовали всё более реалистичной графики. Чтобы рисовать взрывы, тени и отражения в реальном времени, процессорам не хватало духу. Так появились специализированные графические процессоры (GPU) — видеокарты. Их архитектура была принципиально иной. Если CPU — это горстка очень сильных, универсальных математиков, решающих сложные уравнения последовательно, то GPU — это армия из тысяч слабых, но усердных клерков, которые могут одновременно складывать простые числа. А нейросеть, особенно CNN, в своей основе — это именно что миллиарды однотипных простых операций умножения и сложения матриц. Задача, идеально параллелящаяся на тысячи ядер видеокарты.

Конец ознакомительного фрагмента.

Текст предоставлен ООО «Литрес».

Прочитайте эту книгу целиком, купив полную легальную версию на Литрес.

Безопасно оплатить книгу можно банковской картой Visa, MasterCard, Maestro, со счета мобильного телефона, с платежного терминала, в салоне МТС или Связной, через PayPal, WebMoney, Яндекс.Деньги, QIWI Кошелек, бонусными картами или другим удобным Вам способом.

Конец ознакомительного фрагмента
Купить и скачать всю книгу
На страницу:
2 из 2