
Полная версия
Physical AI: От нейросетей к гуманоидным роботам
Ограничение обещаний
Книга не сделает из читателя человека, который «запустил гуманоида в прод» после финальной главы. Она помогает раньше отличать демонстрацию от системы; задавать вопросы ко всему стеку, а не только к весам модели; видеть, где классика всё ещё выигрывает, а где обучение действию реально сокращает интеграцию; не закрывать safety и сервис очередным релизом чекпоинта.
И последнее про ожидания от введения. Здесь нет катарсиса и нет формулы успеха. Есть рабочая рамка: тело меняет цену ошибки; стек шире модели; пилот без метрик врёт; морфология не бесплатна; safety и сервис не клеятся поверх. Если рамка кажется очевидной — хорошо. Дальше начнётся менее очевидное: как именно эти тезисы проявляются в SLAM, в impedance, в датасетах телеопа и в договоре на пилот, где штраф за простой прописан мельче, чем хотелось бы верить.
Physical AI будет двигаться и скачками моделей, и скучными процентами в энергоэффективности приводов, в middleware, в регламентах обслуживания. Держать оба плана сразу скучнее восторженного фида — и заметно дешевле на чужих и своих ошибках. Один рабочий способ не утонуть в миллионе слов — читать «вертикалями». Выбрали сценарий (например, укладка в тару на коротком конвейере) и на каждой части книги помечаете только то, что бьёт в этот сценарий: какой сенсор обязателен, какой fail-soft недопустим, какая метрика пилота, какой форм-фактор вообще не нужен. Остальное пропускаете до другого проекта. Так корпус работает как полка, а не как обязательный сезон сериала.
И да, часть советов в книге устареет точечно: конкретные версии middleware, конкретные платы вывода, конкретные имена моделей. Метод разбора устаревает медленнее — спросить про контур времени, про отказ, про источник данных, про час владения. На этом методе введение и держится.
Ещё одна привычка, которая окупается сразу: записывать не только успехи эпизода, но и «почти». Почти схватил, почти удержал такт, почти не задел стойку. В цифровом ML «почти» часто отбрасывают. В Physical AI «почти» — сырьё для safety и для дообучения, потому что следующий раз геометрия сцены чуть изменится и «почти» станет ударом. Если телеметрия не умеет помечать near miss, вы учитесь только на жёстких провалах — дорого и поздно. Даже грубый флажок от оператора «было опасно» лучше пустого лога.
Если сценариев несколько, не смешивайте их в одном пилотном договоре «чтобы окупить робота». Смешение делает метрики нечитаемыми: улучшили хват — ухудшили навигацию — «в среднем нормально». В среднем нормально — это способ не увидеть ничего.
Дальше — определения и карта поля: что считать Physical AI на практике, чем это не LLM-only стек и не классический цеховой автомат, и почему переход «модель → тело» нельзя закрыть одним API-обёрткой.
1. Что такое Physical AI
На демо-дне стартап показывает гуманоида, который кладёт деталь в лоток. В соседнем зале интегратор крутит шестиосевого робота с камерой: тот же pick-and-place, только без ног и без пресс-релиза про «общий интеллект». Оба спикера произносят Physical AI. Покупатель кивает — и уходит с двумя несовместимыми картинками в голове.
Термин разъехался. В слайдах NVIDIA и в академических треках про embodied AI, в заявках на гранты и в внутренних wiki заводов под ним прячут разное: от anomaly detection на вибрации шпинделя до end-to-end политики, которая выдаёт крутящие моменты. Пока команда не зафиксирует, что именно она строит, споры про стек бессмысленны — оптимизируют разные функции потерь.
Ниже — рабочее определение для этой книги, затем границы: где заканчивается классическая робототехника, где LLM остаётся чатом с побочным эффектом, а где начинается система, за чьё движение кто-то отвечает по инструкции по охране труда.
Определение, которым будем пользоваться
Physical AI — системы, в которых обучаемые модели встроены в контур «сенсоры → решение → актуаторы» и оцениваются по физическому исходу: схватил / уронил / удержал баланс / уложился в такт / не ударил человека, а не по accuracy на тестовом сплите картинок.
Четыре признака, без которых ярлык пустой.
Тело. Есть механизм, способный приложить силу или переместить массу: рука, база, захват, насос, шарнир протеза. Облачный планировщик траекторий без железа — кусок пайплайна, не продукт Physical AI. Продукт начинается там, где выход модели становится током в моторе или уставкой в сервоконтроллере.
Замкнутый цикл. Кадр или пакет проприоцепции влияет на следующее действие; действие меняет сцену; сцена снова входит в оценку. Это не request/response с SLA «ответить за две секунды». Пока VLM «думает» 800 мс, низкоуровневый контур всё равно держит усилие и следит за ограничителями. Мир не ставит паузу.
Другая цена ошибки. Неверный токен в ответе ассистента правят следующей репликой. Неверный момент на запястье — вмятина на корпусе, сорванная резьба, останов линии, в худшем случае травма. Отсюда другие метрики: задержка цикла, поведение при обрыве камеры, ложные срабатывания safety-stop, время до безопасного состояния.
Данные внутри эксплуатации. На классической ячейке программу чаще пишут и валидируют как код. В Physical AI часть поведения живёт в датасетах демонстраций, в симах, в дообучении на провалах смены. Версия политики — такой же релизный артефакт, как прошивка контроллера. Если у вас нет пайплайна эпизодов, а есть только веса «с Hugging Face на удачу», вы ещё не в этой дисциплине.
Итоговая формула короче маркетинга: не «нейросеть на роботе», а инженерия обучения и ограничений там, где движение необратимо.
Что мы сознательно не включаем
Датчик с моделью аномалий без актуатора — edge-аналитика. Полезная, но другая книга.
Цифровой двойник сам по себе. Без железа и без протокола sim-to-real twin отлично рисует KPI и плохо предсказывает люфт редуктора после трёх месяцев пыли.
Разговоры о машинном сознании и сроках «AGI в цеху». Антропоморфный корпус провоцирует такие разговоры; спецификация требований от них только страдает.
Замена любого конвейера «потому что ИИ». Жёсткая оснастка, вибробункер и ПЛК на миллионах одинаковых циклов часто бьют обучаемую политику по стоимости владения и по сертификации. Physical AI окупается там, где номенклатура пляшет, сцены грязные, а интегратор уже недели пишет точки под каждый SKU.
Рядом с классической робототехникой, не вместо неё
Классика не устарела — у неё просто другое узкое место. Кинематика, динамика, ПИД и MPC, силомоментное управление, калибровка tool center point, категории останова, клетки и сканеры безопасны знакомы цехам десятилетиями. Physical AI этот слой не выкидывает. Он меняет, что считается ручной спецификацией, а что — навыком из данных.
Типичная ячейка «по учебнику интегратора»: траектории в среде вендора, последовательность в ПЛК, зрение как детектор отверстия или кода, переналадка — отдельный проект с оснасткой и приёмкой. Такт стабилен. Вариативность низкая. Здесь спорить с классикой чаще всего глупо.
Где классика начинает трещать: 200 SKU вместо 5, мягкая упаковка, детали в навалу, смена приклада каждую неделю, потребность «научить новой операции без вызова вендора». Тогда команда снимает телеоп или ведёт руку kinesthetic teaching, собирает эпизоды, учит политику gaze→grasp, гоняет доменную рандомизацию в симе, выкатывает на железо в shadow mode и смотрит success rate не на трёх дублях для ролика, а на сотнях циклов с ночным освещением и слетевшей калибровкой.
Низкий уровень при этом остаётся скучным и правильным: интерполяция суставов, лимиты тока, watchdog, E-stop. Политика не должна быть единственной линией защиты — иначе сертификация и здравый смысл заканчиваются одновременно.
По осям сравнения, коротко.
Задание поведения: код и оптимизация траекторий vs политики и гибриды (план от VLM → уточнение планировщиком → исполнение контроллером).
Данные: CAD и калибровки vs эпизоды, телеоп, сим, разметка успеха, dataset registry рядом с git.
Обобщение: классика честно не обобщает; обучение обещает обобщение и регулярно врёт на сдвиге распределения. Зрелость — измерить границу, а не спрятать её.
Безопасность: поведение классики в основном специфицировано; у политики спецификация неполная. Значит, нужны независимые мониторы и конверты допустимого усилия/скорости/workspace.
Деньги: классика дешевеет на длинной серии одного движения и дорожает на каждой переналадке. Обучаемый контур дорог в данных и железе отладки; выигрыш появляется только если переналадки реально частые и метрика часа работы посчитана с сервисом, а не «на пальцах».
Гибрид — не стыдный компромисс. Часто это единственный способ пройти пилот: два навыка обучены, остальная логика — автомат, зрение — детектор, хват — импедансный контроль с жёстким потолком силы.
Почему LLM-only — соседняя планета
Языковые и мультимодальные модели дали нормальный интерфейс: «положи красную канистру на поддон у ворот 3». Для оператора это удобнее панелей с двумястами кнопками. На этом удобстве легко построить неверную архитектуру: каждый кадр — в LLM, каждый ответ — в суставы.
Чат терпит секунды. Удержание контакта и баланс — нет. Даже если план строится раз в несколько секунд, сервоциклы идут в килогерцах, а политики хвата обязаны влезать в бюджет бортового инференса. «Спросить модель на каждый кадр» обычно умирает на теплопакете и на очереди CUDA.
Вторая дыра — grounding. Модель может уверенно изобрести шаг, которого нет в сцене. В документе это поправка редактора. В цеху — рука в пустоту или в человека. Инструкция обязана сходиться с детекцией, с картой, с кинематическим досягаемым объёмом и с запретными зонами. Право модели — предложить навык; право монитора — сказать «нет».
Третья — метрики. MMLU и человеческие предпочтения на текстах не предсказывают, сколько раз за смену оператор схватится за подвесок. Нужны: доля успешных циклов, вмешательства на 100 операций, p95 времени такта, энергия на операцию, частота safety-stop, MTTR после сбоя, стоимость часа с учётом механиков.
Четвёртая — данные. Веб для предобучения языка относительно дёшев. Секунда удачной телеоперации на двуруком торсе стоит оператора, износа гриппера и часа инженера, который потом выкинет эпизод с залипшим пакетом проприоцепции. Sample efficiency здесь не академический кружок — это строка бюджета.
Пятая — ответственность. У API-провайдера контракт про uptime и acceptable use. У площадки с роботом — инструкции, расследование инцидента, страхование, иногда уголовный риск. Перенести «политики безопасности чата» на движение нельзя копипастой.
Практичный паттерн для команд из LLM-мира: язык и VLM — диспетчер и объясняльщик над библиотекой навыков; навыки — политики или классические контроллеры с понятным конвертом; ниже — real-time и safety, которые не ждут токенов. Генератор крутящих моментов из сырого LLM — редкая экзотика, не базовый дизайн.
Признаки «физичности» на приёмке идеи
Перед тем как вписать Physical AI в roadmap, пройдитесь по фактам, а не по прилагательным.
Есть актуатор, который меняет среду. Есть сенсор, чья ошибка бьёт по безопасности движения. Есть дедлайны цикла, хотя бы на нижнем уровне. Есть контакт: трение, удар, податливость — то, чего не видно на чистом RGB без силы/тактильности. Часть действий нельзя откатить undo. В зоне бывают люди или дорогое имущество. В KPI сидят простой и инцидент. Поведение предполагается обновлять данными, не только прошивкой траекторий.
Гуманоид необязателен. Мобильный манипулятор на складе с обучаемым хватом — да. Робот-ассистент хирурга — зависит от того, кто закрывает петлю усилия. Чат, который пишет оператору «нажми F3» — пока decision support.
Гуманоид удобен как стресс-тест: много DoF, расход энергии, чужие ожидания «как человек», работа среди мебели и станков, сделанных под людей. Для половины логистических задач две ноги — дорогой способ сделать хуже, чем колеса. Форма корпуса — ответ на среду, не доказательство интеллекта.
Три шаблона, которые встречаются в поле
Классика плюс ML-зрение. Траектории свои, нейросеть говорит, где дырка и под каким углом лежит корпус. Часто окупается за квартал. До «обучаемого поведения» не дотягивает, если новый SKU снова требует программиста.
Политический контур. Камера + проприоцепция (+ иногда язык) → политика → команды в joint или task space; сверху автомат навыков; сбоку независимый safety. Так живут многие lab-to-startup переходы. Ломается на данных, на калибровке и на том, что success в симе не равен success после замены пальца гриппера.
Агент с инструментами на железе. VLM/LLM пишет план, вызывает grasp/navigate/open, навыки внутри — кто во что горазд, память держит карту и статус задачи. Похоже на software-агентов, только каждый tool жрёт батарею и может ударить. Здесь обязательны проверка плана и явный отказ от шага, если perception confidence низкий или зона занята.
Смешивать шаблоны можно. Нельзя смешивать ответственность слоёв так, чтобы после удара никто не знал, чей это был setpoint.
Метрики, которые стоит повесить на стену до выбора вендора
Техника: success rate на зафиксированном наборе сцен; вмешательства человека на час или на 100 циклов; p50/p95 такта; доля и причина safety-stop; энергия на операцию; время возврата к работе после отказа; таблица sim vs iron по тем же задачам.
Продукт: стоимость полезного часа (железо + сервис + простой + обучение операторов); время посадки нового SKU или маршрута; доля смен без выезда инженера; удержание пилота заказчиком после первого месяца.
Риск: тяжёлые инциденты и near miss; время до детекции аномалии; полнота логов для разбора; какой уровень functional safety выбран для зоны и что из этого следует для архитектуры.
«Loss на валидации упал» без этих столбцов —괜찮은я новость для репозитория моделей и слабая для цеха.
Путаница, которая дорого стоит
«ROS и камера есть — значит Physical AI». Есть middleware. Дальше вопрос: обучение меняет действие и вы это меряете на железе?
«Гуманоид = прогресс, остальное наследие». Часто наоборот: колесная база с простым гриппером закрывает задачу, пока гуманоид греет пресс-релизы.
«LLM управляет роботом». Управляет контроллер. LLM планирует и болтает. Если в схеме путаница, получите джиттер и головную боль сертификации.
«Сим заменил данные». Сим нужен. Люфт, задержка шины, износ пальца и мокрый пол он вам не простит, если вы не заложили это в рандомизацию и не провели железную приёмку.
«Политика обучена — программисты свободны». Профиль работ смещается к данным, мониторам, runtime и полевому сервису. Рук нужно не меньше, других.
Уровни автономии вместо магических обещаний
Спорить, «есть ли тут ИИ», бесполезно. Лучше зафиксировать уровень для конкретной операции — грубо, но договорно.
0 — чистый телеоп / ручной режим.
1 — человек ведёт, система стабилизирует и режет опасные команды (стенки, лимиты силы).
2 — отдельные навыки по команде, последовательность у человека.
3 — многошаговая задача в узком домене, человек на супервизии.
4 — смена в согласованной зоне почти без вмешательств, человек на мониторинге.
5 — «везде, как человек» — горизонт с дырами; в пилотах 2020-х обещать его стыдно.
Ценность продукта чаще ищут на уровнях 2–4. Уровень 3 на классическом манипуляторе с imitation policy без всякого чата — нормальный Physical AI. Уровень 1 с огромной LLM в облаке — ещё не он.
Телеоперация с shared autonomy сюда входит как режим: действие физическое, риск разделён, данные копятся. В контракте должна быть доля автономии и условие возврата руля человеку — иначе маркетинг снова победит охрану труда.
Данные как рентген подхода
Посмотрите на артефакты команды. Если главные файлы — программы точек и ladder, вы в классике. Если рядом dataset registry, конфиги сима, протоколы телеопа, дашборд success rate по сменам и rollout политик с canary на одном роботе из парка — вы в Physical AI. Смешанный набор артефактов часто здоров.
Отсюда найм и бюджет: операторы телеопа, люди, которые чистят эпизоды и ловят distribution shift, механики на расходники грипперов. GPU — строка, не вся смета. Выкат без shadow mode и без критерия отката — способ подорвать пилот быстрее, чем плохая модель.
Безопасность внутри смысла, не сбоку
В текстовом ИИ про safety говорят как про контент и alignment. Здесь первее: категории останова, биомеханические лимиты, redundancy, поведение при потере лидара, безопасная поза при падении питания. Политика существует внутри конверта. Кто максимизирует demo-success и «потом прикрутит safety», переписывает архитектуру после первого визита аудитора — или после первого near miss.
Антропоморфные слова
«Руки», «мозг», «понял задачу» хорошо звучат на совете и плохо в спецификации. «Понял» должно раскрываться как: парсинг в план навыков + успешный grounding объектов + прохождение мониторов. «Осторожный хват» — как порог силы, импеданс и условие отпускания. Книга будет возвращать метафоры к механизмам. Человекоподобие корпуса не входит в определение; входит ответственность за контакт.
Две заявки на один бюджет
Плохая: «Внедрить Physical AI на комплектации». Непроверяемо. Кормит спор о словах.
Рабочая: «На зоне Z для N SKU держать success rate не ниже порога S при ≤ K вмешательствах на 100 циклов; навыки grasp/place обновлять без переписки траекторий вендором; safety-слой независим от политики; горизонт пилота ~90 дней, дашборд еженедельно; уровень автономии — 3». Здесь уже видно, что покупать, что писать самим и когда остановиться.
Определение главы нужно затем, чтобы команды чаще писали второе.
Мини-словарь
Политика — отображение наблюдения в действие в цикле или как навык.
Навык — кусок поведения с условиями входа и критерием успеха.
Foundation-модель для роботов — крупная модель на широких сенсомоторных/мультимодальных данных с заявкой на перенос; перенос надо мерить, не цитировать блог.
Grounding — сведение языка/символов к объектам и действиям, которые видны сенсорами и разрешены ограничениями.
Sim-to-real gap — конкретные расхождения (трение, задержка, контакт, износ), из-за которых сим врёт.
Fail-soft — при отказе сузить возможности и остаться предсказуемым, а не «упасть красиво» или продолжать с ложной уверенностью.
Если у вас другие ярлыки — переименуйте. Роли слоёв важнее транслитерации.
Что унести в главу 2
Тело, цикл, цена ошибки, данные в продукте. Классика рядом, не в музее. LLM — полезный верх, опасный низ. Автономия — шкала в договоре. Safety — часть определения. Дальше — как именно зрение и язык стыкуют с действием, где мост держит нагрузку, а где архитектура держится на удачном ролике.
Откуда взялось поле (без юбилейной хроники)
Имеет смысл держать в голове три потока, которые сейчас столкнулись в одном бюджете проекта.
Промышленная и сервисная робототехника давным-давно умеет повторяемое движение в клетке, силовые задачи, навигацию по маякам и картам, хирургические консоли с нулевым правом на самодеятельность. Там культура спецификации и приёмки. Там же привычка, что «новое поведение» = новый выезд интегратора.
Компьютерное зрение и мультимодальные модели научились жить с вариативным светом, смятой упаковкой, инструкцией на естественном языке. Порог входа в «увидеть объект» упал. Порог входа в «сделать с ним что-то надёжное восемь часов» — нет.
Обучение политик (имитация, offline RL, sim-heavy RL) перестало быть только статьёй: появились нормальные телеоп-стенды, открытые симы, привычка логировать эпизоды. Но стоимость единицы данных всё ещё ближе к испытательному стенду, чем к скачиванию корпуса текстов.
Physical AI — стык. Команда, которая выкидывает control и safety как «наследие», получает видео. Команда, которая игнорирует данные и перенос, получает вечный интеграторский контракт. Команда, которая ставит LLM ниже сервоцикла, получает джиттер и неприятный разбор полётов.
Где определение скользит
Хорошо ложится: манипуляция в полуструктурированной ячейке, мобильный pick на складе с размеченной зоной, сервисный робот с коротким меню навыков, заводской пилот гуманоида за барьером или в co-bot режиме с жёстким конвертом.
Скользит: полностью детерминированная высокоскоростная линия — там TCO классики обычно лучше, а «обучение» притягивают ради слайда. Иначе скользит в полностью открытом доме без карты, без права трогать стены и без канала для телеопа: растёт всё сразу — восприятие, исследование, юридический риск, длина пилота.
Серая зона — советы модели при полном ручном исполнении. Как MVP для проверки ценности навыка — разумно. Как статус «мы внедрили Physical AI» — рано. Честная бирка: ассистент оператора с дорогой к автономии. Другая серая зона — удалённый телеоп 90% времени с редкими автономными вставками. Физика есть, данные текут; в паспорте продукта должна быть доля автономии, иначе через полгода никто не вспомнит, что именно продавали.
Пример, который проясняет больше манифеста
Возьмём комплектацию мелкой механики. Классический путь: вибробункер или лотки, сценарное зрение, траектории под семейство деталей, при смене семейства — снова интегратор. Обучаемый путь: оператор телеопом собирает 300–2000 циклов на представителей семейства (порядок величины; точная цифра зависит от вариативности и от того, насколько прощает гриппер), политика закрывает хват и укладку, автомат держит маршрут тары, силовые лимиты независимы, ночные прогоны без человека только после shadow и после порога по near miss.
Где ломается красивая история: смена материала поверхности (масляный металл вместо сухого), новый блистер, камера уехала на 3 градуса после удара уборкой, сим не знал про податливость пены в лотке. Success rate, который в пятницу был «приемлемо», в понедельник требует либо доразметки, либо отката. Вот это — повседневность Physical AI. Не sparring с философией интеллекта.
Если в вашей задаче поверхность и номенклатура стабильны годами, сравните стоимость такого пайплайна с винтом и упором. Иногда упор побеждает — и это взрослый вывод, не предательство прогресса.
Контракт с площадкой: что прописать до монтажа
Определение без договорных зубов снова станет постером. Минимум, который стоит иметь в приложении к пилоту:
Зона и запретные объёмы. Список операций и SKU фазы 1 (узкий!). Целевой уровень автономии. Пороги success и вмешательств. Кто нажимает E-stop и кто имеет право выкатывать новую политику. Как хранятся видео и проприоцепция (персонал в кадре — отдельный разговор). Критерий провала пилота — да, заранее. Обязанность вендора приехать при деградации после обновления. Что происходит с данными после окончания договора.
Без этого «Physical AI» означает «поставили железо и посмотрим». Смотреть обычно начинают после срыва срока.
Организационный отпечаток
Технология меняет оргсхему сильнее, чем кажется на закупке GPU.
Появляется владелец датасета — не «кто-то из ML», а роль с правом стоп-шипа на релиз, если разметка гнилая. Появляется совместный ритуал robotics + ML + OT: одна авария — один разбор, без скидывания через забор. Появляется запрет на demo-driven разработку: ролик для совета директоров снимают с отдельной ветки, не с production weights. Появляется бюджет на расходники и на время людей у телеоп-станций; иначе модель питается мечтами.
Если HR ищет «промпт-инженера для робота» и не ищет человека, который калибровал руки и писал safety case — профиль найма уже врёт определению.
Связь с деньгами без фантазий о рынке
Точные объёмы рынка гуманоидов в открытых отчётах гуляют и плохо сходятся; в этой главе цифры глобального TAM не нужны. Нужна микроэкономика одной ячейки.
Считайте: капитальные затраты на платформу и ограждение; интеграция; стоимость сбора первых датасетов; вычисления; сервисный контракт; простой линии при отладке; зарплата операторов телеопа и супервайзеров; страховка. С другой стороны — сэкономленные часы ручного труда или часы интегратора на переналадках, брак, скорость вывода нового SKU. Если плюс не сходится без чуда «через год само научится всему», у вас не Physical AI-стратегия, а ставка на чудо. Чудеса плохо закрывают квартал.
Оценки сроков окупаемости имеют право жить только с пометкой «оценка» и с чувствительностью: что будет, если success rate застрянет на 85% и человек так и останется в контуре. Часто именно 85% убивает экономику: зарплату оператора вы не сняли, сложность добавили.









