ИИ. История машины, которая научилась говорить
ИИ. История машины, которая научилась говорить

Полная версия

ИИ. История машины, которая научилась говорить

Язык: Русский
Год издания: 2026
Добавлена:
Настройки чтения
Размер шрифта
Высота строк
Поля
На страницу:
9 из 23

Такое разделение не делает демонстрацию менее значимой. Напротив, оно даёт хороший урок о том, как появляются технологии. Сначала идею проверяют на доступной платформе; параллельно строят устройство, которое должно соответствовать новой концепции. Однако фотогеничный образ — «электронный мозг с глазом, который учится» — легко вытесняет невидимую разницу между программой, вычислительным оборудованием и обучаемым правилом.

В лаборатории карточку подбирали под задачу. Исследователь решал, какие визуальные признаки попадут на вход, как закодировать примеры, сколько их предъявить, какой ответ считать правильным и когда закончить обучение. Отметка слева или справа оказалась удачной демонстрационной задачей именно потому, что её можно объяснить и проверить без длинного рассказа. Задача была простой, результат наблюдаемым, а изменение параметров — достаточно наглядным для газетного отчёта.

Но способность выучить обучающую подборку ещё не равна универсальному зрению. Любая система может запомнить примеры, если их мало и они однообразны. Более серьёзная проверка — получит ли она правильный ответ на новые карточки, которые отличаются освещением, размером, наклоном или фоном. Как меняется точность, когда этих случайных изменений много? Как узнать, научилась ли машина общему признаку, а не особенностям конкретного набора? Это вопросы об обобщении, и они сопровождают машинное обучение с первых лет.

Слово «учится» потому требует уточнения. В опыте 1958 года оно обозначало настоящий технический процесс: числовые связи корректировались по примерам. Оно не означало, что машина сама придумала задачу, распознала её смысл или перенесла навык на всё разнообразие мира. Научный результат был уже того газетного будущего, которое люди могли вообразить, но гораздо существеннее простой заранее прописанной сортировки. У машины появился способ менять параметры по обратной связи.

Маршрут сигнала внутри Mark I

У физического Mark I Perceptron была более сложная схема, чем одна формула на доске. Система связывала три вида элементов: сенсорные (S), ассоциативные (A) и ответные (R). Такой язык напоминает нейрофизиологию, но обозначает конкретные части модели. Сенсорные элементы получали вход; ассоциативные объединяли сигналы; ответные формировали один из вариантов вывода.

Представить маршрут можно как три этапа. Светочувствительные элементы превращали рисунок в электрические сигналы. Сигналы проходили к ассоциативным элементам, где некоторые комбинации могли активироваться сильнее других. Затем система передавала результат на выход, который показывал выбранный класс. Это не была камера, которая сохраняла целостную фотографию и затем «вспоминала» её по-человечески. Изображение превращалось в набор ограниченных сигналов, а ответ зависел от пути и силы связей.

О музейном аппарате часто пишут, что он имел сетку из 400 светочувствительных элементов — своего рода входную сетчатку 20 на 20. Такая сетка хорошо показывает, насколько грубым был зрительный вход, если сравнивать его с человеческим зрением. Но количество сенсоров само по себе не говорит, что машина распознавала. Разрешение изображения, схема соединений, настройка, задача и способ обучения вместе определяли, что система могла сделать.

Здесь особенно легко ошибиться, вообразив, что «все провода обучались». В Mark I не каждая связь свободно меняла свою силу. Архитектура включала фиксированные соединения от S-элементов к A-элементам и регулируемые связи между A и R. Части схемы задавались конструкцией, а часть весов могла изменяться во время обучения. Именно поэтому не стоит без оговорки переносить на исторический аппарат компактную формулу современного однослойного классификатора, где все параметры описаны одним и тем же набором символов. Mark I был устройством определённого типа, а «перцептрон» — более широким понятием.

Внешний вид машины тоже не был пустой декорацией. Устройство с реальными датчиками, проводами и переключателями позволяло исследователям изучать, какие части системы можно реализовать электронно, как физическая архитектура влияет на вычисление и какие формы обучения доступны. Аппаратная реализация задавала ограничения на скорость, число соединений, способ задания обратной связи и стабильность компонентов. В эпоху, когда вычисления стоили дорого, конструкция была частью научной гипотезы.

При этом физический размер мог производить впечатление, несоразмерное возможностям. Человек видел шкафы, лампы, сетку, похожую на глаз, и невольно заполнял пробелы воображением. В действительности внутри не сидел маленький наблюдатель. Электроника принимала сигнал, комбинировала его по заданной структуре и выдавала ответ. Это не уменьшает достижения инженеров. Просто оно помогает оценить его точно: необычным был не искусственный субъект, а экспериментальная машина для проверки того, можно ли изменить распознавание через опыт.

Что значило обучаться без примеров от всего мира

Принцип обучения на примерах сегодня связывают с огромными наборами данных. Mark I работал в совершенно иной среде. Изображение приходилось подготовить, образцы были ограничены, а сама вычислительная техника несравнима с нынешней. Вопрос состоял не в том, можно ли загрузить в машину миллионы фотографий, а в том, как связать несколько сотен входных сигналов с правильным выбором и затем скорректировать ограниченное число весов.

Это не было «обучением без человека». Люди выбирали, каким будет пример, где провести границу между классами, как представить данные и какие соединения аппаратно доступны. В обучении с учителем, как позже назовут распространённый подход, система получает пример вместе с меткой — указанием правильного ответа. Если на карточке ожидается «левая отметка», исследователь должен сообщить это системе. Машина меняет параметры, но критерий верного ответа пришёл от человека.

В простом современном объяснении это похоже на настройку компаса по серии маршрутов. Если прибор ошибочно уводит направо, мы сравниваем результат с контрольным направлением и слегка подкручиваем настройки. После многих проверок прибор становится полезнее для выбранного типа маршрутов. Однако аналогия перестаёт работать, если представить, что он самостоятельно понял географию или решил, куда стоит идти. Он подстроился под цель и примеры, которые задали люди.

И ещё одно различие: хорошо подстроиться под виденные карточки — не то же самое, что правильно работать на незнакомых. Если все учебные карточки одинаковы, модель может уловить случайный признак — например, царапину в углу, — а не расположение отметки. Тогда в лаборатории кажется, что она «выучила» задачу, но новое освещение рушит результат. Чтобы проверить обобщение, нужны новые примеры и честное разделение между материалом обучения и материалом проверки. В 1958 году терминология ещё складывалась, но сама проблема была уже здесь.

Позднейшие рассказы иногда противопоставляют «обучение» и «программирование», как будто с перцептроном программист исчез из уравнения. Точнее сказать, человеческая работа переместилась. Инженер меньше пишет индивидуальные инструкции для каждого случая и больше проектирует архитектуру, данные, процедуру корректировки и критерии оценки. Ошибки тоже становятся иными: если правила явные, можно искать неверную строку кода; если поведение зависит от множества весов, приходится исследовать данные и обучение.

Для своего времени это был важный поворот. Розенблатт не снял с людей ответственность за постановку задачи. Он предложил способ, при котором часть внутреннего решения могла возникнуть из примеров. Машина перестала быть только исполнителем списка инструкций; она стала системой, чья будущая реакция зависела и от того, как её обучали.

Мозг в заголовке

Пресса быстро подхватила демонстрацию. Заголовок The New York Times объявлял о новом устройстве военно-морских сил, которое «учится, как оно действует». В подобных материалах можно было встретить предсказания о чтении, распознавании, речи, исследовании космоса и системах, способных самостоятельно адаптироваться. Некоторые формулировки принадлежали не журналистам, а самому Розенблатту, который говорил о возможном будущем с заметным энтузиазмом.

Это не значит, что он обманывал публику. Он действительно считал перцептрон важным шагом к адаптивным системам и хотел исследовать, насколько далеко можно развить эту идею. Но публичный язык почти всегда уплотняет перспективу. В лаборатории фраза «мы показали процедуру обучения для ограниченной задачи» превращается в «машина учится». В следующем пересказе исчезает ограниченная задача. Ещё шаг — и способность различать карточки звучит почти как понимание изображения вообще.

Такой сдвиг работает в обе стороны. Большие обещания помогают привлечь внимание и средства, а скромный технический результат может показаться публике слишком малым, если он описан без будущего. Однако если ожидания растут быстрее результатов, неизбежно наступает разочарование. Общественная дискуссия тогда спорит не с реальным перцептроном, а с обещанным машинным разумом.

Подобная динамика повторялась во многих технологических эпохах, но глава о перцептроне не должна превращаться в нравоучение про «хайп». В 1958 году был настоящий научный результат: компьютерная процедура могла корректировать числовые связи на основе примеров. Было и реальное теоретическое предложение исследовать обучение и восприятие математически. Были ожидания, часть которых превосходила доказанное. Все три слоя сосуществовали, а не сменяли друг друга аккуратными эпохами.

Полезный вопрос для читателя — не «правда ли, что машина училась?», а «какой именно навык она приобрела, на каких данных и каким способом?». Это вопрос, который пригодится и спустя десятилетия, когда системы будут выглядеть гораздо убедительнее. Чем человечнее звучит ответ машины, тем важнее понимать, на чём он основан.

Тобермори, который должен был услышать

Розенблатт и его коллеги не ограничивали идею только изображениями. Один проект носил имя Тобермори — говорящего кота из рассказа Саки, английского писателя Гектора Хью Манро. В рассказе животное начинает говорить с людьми и обнаруживает, что человеческая учтивость плохо выдерживает честный разговор. В лаборатории имя относилось к проекту распознавания речи.

Тобермори не был бытовым голосовым помощником, не отвечал на вопросы и не понимал разговор. Задача распознавания речи — определить, какие звуковые образцы соответствуют каким категориям или словам. Это уже иной вход: не световые элементы и пространственный рисунок, а меняющийся во времени сигнал, в котором влияют голос, темп, произношение и шум. Подход, основанный на обучаемых связях, мог быть привлекательным именно потому, что заранее выписать все варианты произношения было трудно.

Название проекта иногда рассказывает о научной группе больше, чем серьёзная терминология. Оно соединяло техническую задачу с литературной шуткой, но в этой шутке был риск: в реальности программа не получала ни остроты, ни независимости книжного кота. Она должна была классифицировать акустический материал. Между голосом, который можно услышать, и смыслом, который слушатель ему приписывает, лежит длинная цепочка вычислений и человеческих ожиданий.

Группа Розенблатта была смешанной. В работе участвовали инженеры, программисты и молодые исследователи; позже сотрудники вспоминали, как помещения лаборатории постепенно заполнялись специальными машинами и экспериментальным оборудованием. Среди историй, которые сохранила Cornell Chronicle, — программист Билл Айснер, которому приходилось превращать замысел в работающий код, и Террелл Кокен, которого Розенблатт привлёк к работе подростком, в шестнадцать лет. Исследовательская программа существовала не только в статьях знаменитого руководителя. Её собирали люди, которые настраивали аппаратуру, готовили данные, отлаживали программы и проверяли, что именно происходит после очередной итерации.

В этом есть человеческий масштаб истории, который теряется в рассказе о «машине, учившейся сама». За каждым набором примеров стояли чьи-то часы подготовки. За каждым результатом — чьё-то решение, что считать ошибкой. За красивой демонстрацией на сцене — программисты и техники, которые должны были сделать так, чтобы система вообще запустилась. Автоматизация меняет распределение труда, но редко устраняет труд.

Есть ещё один любопытный эпизод: для исследований речи и восприятия Розенблатт использовал наблюдательные и экспериментальные пространства, связанные с собственным домом и обсерваторией. Эта деталь напоминает, как далеко академическая работа могла выходить за пределы стандартной лаборатории. Но важнее не романтический образ учёного, работающего под звёздами, а то, что изучение интеллекта тогда ещё не было разделено на современные дисциплинарные коробки. Психологические гипотезы, электронные схемы, анализ речи и теория обучения могли обсуждаться одной исследовательской группой.

Где проходит предел одной границы

Любая история о перцептроне рано или поздно приходит к XOR — исключающему ИЛИ. Эта логическая операция выдаёт «да», если два входа различаются: при сочетании 0 и 1 результат равен 1, при 1 и 0 — тоже 1, а при 0 и 0 или 1 и 1 — 0.

Представим четыре угла квадратной карты. На двух противоположных углах поставим точки класса «да», на двух других — класса «нет». Попробуйте провести одну прямую так, чтобы все «да» оказались по одну сторону, а все «нет» — по другую. Не получится. Прямая неизбежно захватит точку неправильного класса или оставит правильную по ту сторону. Тут не требуется сложная математика: достаточно нарисовать точки и проверить варианты.

Таков предел однослойного перцептрона: он может построить линейную границу, а XOR требует нелинейного разделения. Значит ли это, что нейронные сети в целом не способны вычислить XOR? Нет. Сеть с дополнительным слоем может сначала создать новые промежуточные признаки, а затем разделить классы. Простейший пример можно построить даже вручную. Но остаётся инженерный вопрос: как системе научиться подходящим внутренним признакам, а не получить их готовыми от человека?

XOR полезен именно как простая наглядная модель архитектурного ограничения. Он показывает, что на результат влияет не только объём примеров, но и форма вычислительной системы. Если задать задачу, которую выбранная модель не может выразить, повторение примеров не поможет. Эта мысль актуальна и в современном машинном обучении: не всякий алгоритм одинаково подходит для любой задачи.

Проблема возникает, когда учебный пример становится целой историей. Из того, что простейший перцептрон не может вычислить XOR, иногда выводят, будто нейронные сети были математически опровергнуты. Это чрезмерное обобщение. Ограничение касалось однослойной модели и других свойств изучаемых архитектур. Оно не доказывало, что никакие многослойные сети не способны вычислять сложные функции. Оно делало более острым следующий вопрос: если дополнительные слои нужны, как их эффективно обучать?

Минский, Пейперт и математическая критика

В 1969 году Марвин Минский и Сеймур Пейперт опубликовали книгу Perceptrons: An Introduction to Computational Geometry. Её часто описывают как гвоздь, забитый в крышку нейронных сетей. Это сильный образ, но плохое резюме содержания.

Книга была математическим исследованием возможностей определённых классов перцептронов. Авторы анализировали, какие задачи система способна представлять и какие ограничения возникают из её структуры. В центре были не только простые логические примеры, но и более общие свойства распознавания конфигураций, геометрии, локальных связей и способов построения вычислений. Это был подробный аргумент о том, что можно и чего нельзя получить из конкретного семейства моделей при заданных архитектурных условиях.

Один из полезных результатов такой критики — заставить сторонников метода сформулировать границы обещаний. Если однослойная система не может различать определённые структуры, это важный факт для теории и практики. Математический контраргумент не становится несправедливым от того, что его позднее могли пересказать упрощённо.

В то же время влияние книги нельзя отделить от научной среды. Минский был выдающимся исследователем, чьи идеи и институциональный вес привлекали внимание. В конце 1950-х и 1960-х символический ИИ укреплялся в лабораториях и получал ресурсы; нейросетевые направления конкурировали с ним за внимание, деньги и молодые кадры. Историки науки изучали, как математические результаты были интерпретированы внутри этой борьбы. Распространённое прочтение «сложные сети бесполезны» не совпадает с буквальным утверждением, что авторы математически доказали невозможность любого обучения в многослойной сети.

В 1988 году, когда вышло расширенное издание, сами авторы обсуждали, что изменилось с момента первой публикации. Уже сам факт продолжения спора показывает: книжный миф о едином вердикте скрывает более длинную дискуссию. Математика книги была реальной; её воздействие зависело также от того, какие исследования считались перспективными и кому доверяли финансирующие организации.

Розенблатт и Минский знали друг друга ещё со школы — Bronx High School of Science. Позднее они спорили публично о потенциале нейронного подхода. Розенблатт называл Минского «лояльной оппозицией» — человеком, чья критика была постоянной частью дискуссии. Эта фраза звучит живее, чем легенда о личных врагах, но всё равно не даёт полного доступа к их отношениям. У нас есть публичная история научного спора, а не право сочинять частные мотивы.

Соперничество можно описать точнее, если спросить, что каждая сторона считала продуктивным объяснением интеллекта. Символический подход строил явные представления, правила, планы и логические операции. Нейросетевой подход исследовал, как навыки могут возникать из связей и адаптации. Вопрос был не в том, кто из учёных любил машины больше. Нужно ли сначала описать интеллектуальную задачу через символы, или часть её структуры можно извлечь из примеров? Эти две программы предлагали разные ответы и разные виды доказательств.

Минский и Пейперт не были единственной причиной охлаждения интереса к нейросетям; сам Розенблатт не был обладателем решения, которое просто ждало денег. Ограничения вычислительной техники, трудность построения и обучения более сложных сетей, доступность конкретных задач, смена приоритетов финансирования и успехи альтернативных подходов действовали одновременно. Когда идею принимают или откладывают, редко существует один документ, в котором написано: «с этого дня направление закрывается». Чаще решение принимают многие лаборатории, грантовые комиссии, руководители проектов и молодые исследователи, выбирающие тему диссертации.

Почему простота работала против обещаний

У перцептрона была двойная репутация. С одной стороны, он демонстрировал новое отношение к программе: параметры могли меняться на примерах. С другой — самые наглядные задачи были слишком узки, а математические ограничения слишком понятны, чтобы не задавать следующий вопрос. Если система распознаёт отметку на карточке, научилась ли она видеть? Если она различает речь, поняла ли она слова? Если она подстраивает веса, приобрела ли она общее знание?

На каждый вопрос приходилось отвечать отдельно. Нет единственной шкалы, по которой способность классифицировать простые входы превращается в человеческое восприятие. Набор задач мог расширяться, но вместе с ним росли требования к сенсорам, архитектуре, памяти, данным и вычислениям. В 1950-х доступная аппаратура не могла предоставить ресурсы, которые современные исследователи считают обычными.

При этом было бы ошибкой свести неудачу к «не хватило компьютеров». Даже с большими вычислениями неподходящая структура останется ограниченной. И наоборот, мощная теория без подходящего оборудования может годами оставаться исследовательским обещанием. Для полезной системы требуется совпадение нескольких условий: выразительная архитектура, метод обучения, примеры, вычислительные ресурсы и задача, на которой результат имеет ценность. Перцептрон показал лишь часть этой комбинации.

Символический ИИ тогда мог выглядеть практичнее. Если эксперт умеет объяснить, почему неисправна деталь или как доказать утверждение, можно попросить его сформулировать правило. Это обещало прозрачность: программист мог открыть список знаний и проследить путь решения. Нейросеть же предлагала подстраивать параметры, а значит, часть рабочего знания оказывалась распределена в числовой конфигурации. Для исследователя 1960-х это не обязательно было преимуществом. Если результат неверен, не всегда понятно, что именно нужно исправить.

Но и у явных правил обнаружился свой предел. Человек часто умеет распознавать лицо, акцент или тонкую неисправность, но плохо формулирует полный перечень признаков, которыми пользуется. Экспертное знание не всегда доступно в форме коротких инструкций. Спор методов в итоге был не просто между «объяснимым» и «необъяснимым» ИИ, а между разными трудностями: как извлечь правила из головы человека и как извлечь структуру из примеров, не потеряв возможность проверить результат.

От нервной клетки к вычислительному элементу

Розенблатт не начал с пустого листа. К середине XX века уже существовали разные попытки описать нервную систему языком математики и электрических цепей. В 1943 году Уоррен Мак-Каллок и Уолтер Питтс предложили формальную модель нейрона: элемент получал сигналы и срабатывал, если определённое условие выполнялось. Их работа показала, как из простых бинарных элементов можно составлять логические операции. Это была важная интеллектуальная предпосылка, но не готовый перцептрон и не полный план мозга.

Здесь легко незаметно подменить историю. Когда сегодня говорят «нейросеть», может показаться, будто учёные просто поочерёдно копировали биологию всё точнее. На деле они выбирали отдельные свойства нервной системы, которые можно было выразить математически и проверить на доступной технике. У Мак-Каллока и Питтса акцент был на логическом вычислении. Розенблатта интересовала адаптация: что происходит, если связи между элементами меняются на опыте?

Переход от логического нейрона к обучаемому элементу менял сам тип вопроса. Если входы активируют нейрон по заранее заданному правилу, можно строить сложные логические схемы. Если же сила связей может перестраиваться, система получает шанс выработать разные реакции без того, чтобы программист выписал их все. В обоих случаях элементы искусственные, но исследовательские ставки отличаются: в первом случае важно вычисление по фиксированной схеме; во втором — возможность изменять схему по данным.

Научный язык середины века был полон слов вроде «мозг», «память», «обучение» и «организация». Они помогали объединить психологов, инженеров и математиков, но легко обещали больше, чем содержали формулы. В статье Розенблатта нейронная сеть описывалась как вероятностная модель хранения и организации информации. Слово «вероятностная» здесь существенно: речь шла о поведении системы в классе возможных входов и связей, а не о том, что каждый отдельный провод случайно угадывает ответ.

Называя систему мозгоподобной, нужно каждый раз уточнять: в каком именно отношении? У Mark I были датчики, соединённые с ассоциативными и ответными элементами. Это напоминает общий маршрут от ощущения к ответу. Но оно не означает, что в машине воспроизводились зрительная кора, память, внимание или субъективное ощущение видеть. Сходство задаёт исследовательскую аналогию; оно не подтверждает тождество механизма.

Подобные оговорки не лишают нейронный подход его научного значения. Модель мозга может быть полезна, даже если она сильно упрощена: благодаря упрощению можно спросить, какой минимальный набор правил объясняет наблюдаемое поведение. Перцептрон был не фотографией мозга, а лабораторным стендом для вопроса об адаптации. Его ценность измеряется тем, что на нём можно было формулировать гипотезы о поведении обучаемой системы и затем смотреть, что происходит.

Что именно меняется после ошибки

Чтобы понять, почему исследователей занимали «веса», представим два сигнала на входе. Один — пиксель или датчик, реагирующий на положение отметки в левой части карточки; другой реагирует на правую. Если система слишком часто голосует за класс «левая отметка», можно ослабить влияние входов, которые сопровождали ошибочные решения, и усилить те, которые указывали на другой ответ. Простая модель не знает, что отметка «находится слева». Она получает набор чисел и меняет коэффициенты, чтобы итоговая комбинация лучше совпадала с заданной меткой.

Вес — не маленький кусок знания с подписью «левый край». Он лишь числовой множитель. Если конкретный вход обычно поддерживает правильный ответ, его вес может сделать влияние сильнее. Но значение каждого коэффициента зависит от остальных входов и от представления задачи. Перемешай кодирование, добавь новые признаки или измени способ нормализации — и те же числа будут означать другое.

На страницу:
9 из 23