
Полная версия
ИИ без паники. Практическая книга о нейросетях для тех, кто не программист
Этап третий: настройка на человеческие предпочтения
Самый интересный и самый спорный этап. Технически он называется «обучение с подкреплением на основе обратной связи от человека».
Схема такая.
Модель генерирует несколько вариантов ответа на один запрос. Люди-оценщики ранжируют их: этот лучше, этот хуже. На собранных ранжировках обучается отдельная модель-«судья», предсказывающая, какой ответ человек предпочтёт. Затем основную модель дообучают так, чтобы она максимизировала оценку судьи.
Что это даёт. Ответы становятся полезнее, вежливее, безопаснее, лучше структурированными. Модель перестаёт выдавать откровенно вредный контент. Именно этот этап превратил малоизвестную технологию в продукт, которым пользуются сотни миллионов.
Что это создаёт как побочный эффект — и это важно понимать.
Склонность соглашаться. Люди-оценщики чаще выбирают ответы, которые им приятны. Модель усваивает, что соглашаться выгоднее, чем спорить. Отсюда знаменитая уступчивость: скажите модели «ты не прав» — и она с высокой вероятностью извинится и согласится, даже если была права. Это не признание ошибки, это выученное поведение.
Многословие. Развёрнутые ответы кажутся оценщикам более полезными. Модели склонны к избыточности.
Осторожность. Отказ выглядит безопаснее, чем рискованный ответ. Отсюда лишние оговорки и отказы в безобидных ситуациях.
Отпечаток ценностей. Оценщики — конкретные люди с конкретными представлениями. Их предпочтения впечатываются в модель. Это одна из причин, почему разные модели по-разному отвечают на спорные вопросы.
Практический вывод для вас. Никогда не используйте согласие модели как подтверждение своей правоты. Если вы хотите проверить идею, не спрашивайте «хорошая ли это мысль?». Спрашивайте: «Разбери эту идею как строгий скептик. Найди три причины, почему она не сработает». Формулировка запроса меняет результат кардинально.
Этап четвёртый (опциональный): специализация
Некоторые модели дополнительно адаптируют под конкретную область: юридические тексты, медицинские сценарии, банковские регламенты, техническую поддержку конкретного продукта.
Есть несколько способов, и их полезно различать, потому что вы будете встречать эти слова.
Дообучение. Модель дополнительно обучают на специализированном корпусе. Меняются веса. Дорого, требует данных и экспертизы, но даёт глубокую адаптацию.
Подключение к базе знаний. Модель не переучивают. Вместо этого при каждом запросе система ищет релевантные фрагменты в корпоративной базе документов и подставляет их в контекст. Модель отвечает, опираясь на найденное. Этот подход обозначают аббревиатурой RAG.
Именно так работает большинство корпоративных внедрений: он дешевле, быстрее обновляется и позволяет ссылаться на источник.
Инструкции в системном сообщении. Самый простой способ: модели просто дают развёрнутое описание роли и правил перед началом работы. Так устроены «кастомные ассистенты» в популярных сервисах.
Знание против доступа
Ключевое различение, которое многое объясняет.
Есть то, что «зашито» в параметры модели при обучении, — это знание. Оно обширное, но приблизительное, устаревающее и не поддающееся проверке.
И есть то, что модель получает в момент запроса, — контекст. Это может быть ваш текст, найденные в интернете страницы, документы из базы, результат вычисления.
Ответы, опирающиеся на контекст, надёжнее ответов, опирающихся на память. Существенно надёжнее.
Отсюда практическое правило, которое повысит качество вашей работы больше, чем любые ухищрения с формулировками: давайте модели исходники.
Не «расскажи мне про договор аренды» — а «вот текст договора, разбери его».
Не «какие сейчас правила по НДС» — а «вот выдержка из закона, объясни».
Не «что было на совещании» — а «вот расшифровка, сделай выжимку».
Разница в качестве огромна.
Глава 11. Контекст, память и то, что называют «рассуждением»
Контекстное окно
Контекстное окно — это объём текста, который модель может держать «перед глазами» одновременно: ваш запрос, вся история диалога, приложенные файлы, найденные материалы, системные инструкции и генерируемый ответ.
Измеряется в токенах. Динамика впечатляет:
— 2020 год: около 2 тысяч токенов, примерно полторы страницы;
— 2022 год: 4—8 тысяч, до десяти страниц;
— 2023 год: 32—128 тысяч, до трёхсот страниц;
— 2024—2026 годы: от 200 тысяч до нескольких миллионов у отдельных моделей.
Миллион токенов — это порядка полутора-двух тысяч страниц текста. Полное собрание сочинений среднего писателя.
Что происходит при переполнении
Когда разговор перестаёт помещаться в окно, начало вытесняется. Модель буквально забывает, о чём вы говорили в начале.
Признаки: она начинает противоречить сказанному ранее, теряет заданный вами формат, «забывает» инструкции, повторяется.
Что делать. Не вести один бесконечный диалог. Когда чувствуете, что разговор поплыл, попросите: «Сделай краткое резюме всего, о чём мы договорились, в виде списка». Скопируйте резюме. Откройте новый диалог, вставьте резюме в начало. Продолжайте с чистой памятью.
Это простой приём, который решает большинство проблем с длинными разговорами.
Проблема «потерянного в середине»
Отдельная тонкость: даже когда всё помещается в окно, модель не одинаково хорошо использует разные части контекста.
Информация в начале и в конце усваивается лучше, чем в середине. Это устойчивый эффект, воспроизводящийся у разных моделей. Он напоминает человеческий «эффект края» в запоминании списков.
Практический вывод. Самое важное — в начало запроса и в конец. Если приложили большой документ, повторите ключевой вопрос после него: «Итак, ещё раз: меня интересует пункт 7.3 — какие обязательства он накладывает?»
Память между сессиями
По умолчанию каждый новый диалог начинается с чистого листа. Модель не помнит вас.
Многие сервисы добавили функцию памяти: система сохраняет отдельные факты о вас («работает юристом», «предпочитает короткие ответы», «пишет книгу об ИИ») и автоматически подставляет их в начало новых разговоров.
Технически это не «модель вас запомнила». Это внешняя записная книжка, содержимое которой ей показывают каждый раз.
Практика. Настройте память сознательно. Один раз напишите развёрнутую справку о себе: род занятий, отрасль, типичные задачи, предпочтения по стилю, что вас раздражает в ответах. Это сэкономит вам сотни повторяющихся объяснений.
Обратная сторона: если в память попал неверный факт, он будет портить все последующие разговоры. Проверяйте, что там записано, и чистите.
Модели, которые «думают»
С 2025 года массово распространились так называемые рассуждающие модели.
Идея простая: прежде чем дать ответ, модель генерирует длинную внутреннюю цепочку рассуждений — разбирает задачу, пробует подходы, проверяет себя, замечает ошибки, возвращается. Пользователю показывается только итог (или сокращённая версия размышлений).
Работает это потому, что каждый шаг генерации — это дополнительное вычисление. Дав модели «место, чтобы подумать», мы даём ей больше вычислительного ресурса на задачу. Отсюда термин «вычисления во время ответа».
Где это радикально помогает: математика, логические головоломки, программирование, многошаговый анализ, планирование, задачи с подвохом.
Где это не помогает: простые вопросы, творческие задачи, переформулирование. Здесь рассуждающая модель просто медленнее и дороже.
Практический совет. Многие сервисы позволяют выбрать режим или делают это автоматически. Правило: если задача решается «в одно действие» — берите быструю модель. Если требует нескольких шагов и точности — включайте режим рассуждения и терпите ожидание.
Приём «подумай вслух»
Даже с обычной моделью работает трюк: попросить рассуждать пошагово.
Сравните два запроса.
«В корзине было 23 яблока. Взяли 8, потом положили в два раза меньше, чем взяли, потом убрали треть от того, что стало. Сколько осталось?»
«Реши задачу пошагово, показывая каждое вычисление, потом проверь результат обратным счётом. В корзине было 23 яблока…»
Второй вариант даёт заметно более надёжный результат. Механизм тот же: вы вынуждаете модель потратить больше шагов генерации, и промежуточные результаты становятся опорой для последующих.
Инструменты: когда модель перестаёт угадывать
Современные системы умеют не только говорить, но и вызывать внешние инструменты:
— поиск в интернете — для свежих фактов;
— исполнение кода — для вычислений и обработки данных;
— работа с файлами — чтение документов, таблиц, изображений;
— обращение к внутренним базам организации;
— управление другими программами.
Это меняет надёжность качественно. Модель, которая посчитала на калькуляторе, не ошибётся в арифметике. Модель, которая нашла страницу и цитирует её, не выдумает факт.
Практический вывод. Когда вам нужна точность, явно просите использовать инструмент: «найди в интернете и приведи ссылки», «посчитай кодом, а не в уме», «работай только по приложенному файлу и не добавляй ничего от себя».
Глава 12. Мультимодальность: когда модель видит и слышит
Что означает слово
Модальность — это канал информации: текст, изображение, звук, видео. Мультимодальная модель работает с несколькими каналами одновременно.
Ранние LLM понимали только текст. Современные принимают на вход изображения, документы, аудио, иногда видео — и могут порождать изображения, речь, музыку.
Как модель «видит»
Механизм оказался элегантным: изображение разбивается на квадратные фрагменты, каждый фрагмент превращается в вектор — и дальше обрабатывается ровно так же, как токены текста. Для трансформера нет разницы, откуда пришёл вектор.
Благодаря этому модель может рассуждать о картинке и тексте вместе: «на этом графике видно снижение, что противоречит утверждению в третьем абзаце».
Что это даёт практически
Список сценариев, которые работают уже сейчас и которыми мало кто пользуется.
Фотография документа. Сфотографировать бумажный договор, счёт, справку, инструкцию — и попросить объяснить, найти условия, перевести, свести в таблицу.
Разбор скриншота. Ошибка в программе, непонятный интерфейс, странное уведомление — покажите картинку и спросите, что делать.
Чтение графиков и схем. Сфотографировать слайд с диаграммой и попросить описать словами и сделать выводы.
Рукописный текст. Расшифровать записи, конспекты, старые письма. Качество на русской рукописи среднее, но часто достаточное.
Бытовые задачи. Фото содержимого холодильника → варианты ужина. Фото растения → определение вида и уход. Фото сыпи или родинки → предварительная информация (с обязательной оговоркой: это не диагноз, к врачу всё равно).
Фото щитка, счётчика, шильдика на технике → расшифровка обозначений.
Фото блюда в ресторане на незнакомом языке → что это и из чего.
Разбор чертежа или схемы сборки.
Каждый из этих сценариев экономит от пяти минут до часа. Вместе они меняют отношение к телефону: камера становится способом задать вопрос.
Голос
Голосовые режимы прошли большой путь. Ранние работали по схеме «распознать речь → обработать текст → синтезировать ответ», с заметными паузами и механическим звучанием.
Современные обрабатывают звук напрямую, реагируют с задержкой в доли секунды, различают интонацию, позволяют себя перебивать, говорят с естественными паузами и эмоциями.
Где голос действительно удобнее текста:
— за рулём, на прогулке, во время рутинных дел;
— языковая практика — терпеливый собеседник, не устающий от ваших ошибок и не смеющийся над акцентом;
— проговаривание мысли вслух — многим думается лучше в разговоре, чем в письме;
— быстрая диктовка идеи с последующим превращением в текст;
— для людей с трудностями при наборе текста.
Генерация изображений
Отдельный большой мир. Подробно — в Главе 20, здесь только принцип.
Диффузионные модели обучают так: берут картинку и постепенно добавляют шум, пока не останется чистая рябь. Модель учится обращать этот процесс — из шума восстанавливать изображение. Затем ей дают текстовое описание как ориентир, и она «проявляет» из шума картинку, соответствующую описанию.
Отсюда характерные свойства: изображение появляется целиком, постепенно уточняясь; результат сильно зависит от случайного начального шума (поэтому каждый раз разный); модель хорошо схватывает общий стиль и хуже — точные детали вроде текста на вывеске или количества пальцев.
Видео и звук
К 2026 году генерация видео по текстовому описанию даёт правдоподобные ролики длиной от нескольких секунд до минуты, с движением камеры, согласованными объектами и звуком.
Генерация музыки позволяет получить трек в заданном жанре с вокалом и текстом за минуту.
Клонирование голоса требует нескольких секунд образца.
Последнее — источник серьёзной опасности, и мы вернёмся к этому в Главе 35. Схема «звонок от родственника голосом родственника» перестала быть фантастикой.
Глава 13. Природа ошибки: откуда берутся галлюцинации
Термин и его смысл
Галлюцинацией называют ситуацию, когда модель выдаёт информацию, которой не существует, — уверенно и правдоподобно.
Термин неудачный: он подразумевает сбой, отклонение от нормы. На самом деле это прямое следствие принципа работы.
Почему это неизбежно
Модель всегда генерирует наиболее вероятное продолжение. У неё нет отдельного механизма проверки истинности. Нет базы фактов, с которой можно сверить. Нет ощущения «я не знаю».
Когда вы спрашиваете про существующую вещь, вероятное продолжение совпадает с правдой — потому что в обучающих данных об этом писали.
Когда вы спрашиваете про несуществующую или редкую вещь, модель всё равно генерирует вероятное продолжение. Просто теперь оно не соответствует реальности.
Для модели эти два случая неразличимы. Она делает одно и то же.
Проведите эксперимент: спросите модель о книге, которой не существует. «Расскажи о книге „Тени над Ладогой“ писателя Кирилла Мещерякова». С высокой вероятностью вы получите развёрнутый пересказ несуществующего произведения с сюжетом, темами и годом издания. Не потому, что модель врёт, а потому, что она продолжает текст в наиболее вероятном направлении.
Современные модели стали заметно осторожнее и чаще говорят «я не нахожу информации о такой книге». Но полностью это не устранено и вряд ли будет устранено в рамках нынешнего подхода.
Где галлюцинации особенно вероятны
Зоны повышенного риска, которые стоит запомнить:
Точные ссылки и библиография. Модель охотно порождает правдоподобные, но несуществующие статьи с реальными фамилиями авторов и правдоподобными названиями журналов. Есть известные случаи, когда юристы подавали в суд документы со ссылками на несуществующие прецеденты — и получали санкции.
Цитаты. Приписывание реальным людям слов, которых они не говорили. Особенно опасно с известными личностями: модель «знает», как они обычно выражаются, и достраивает.
Цифры и статистика. Проценты, суммы, даты — здесь модель ошибается легко и уверенно.
Узкоспециальные и локальные темы. Чем меньше данных было в обучении, тем выше риск. Региональное законодательство, малоизвестные компании, местные особенности, редкие профессиональные детали.
Свежие события. Всё, что произошло после отсечки знаний.
Персоналии. Биографии людей средней известности — гремучая смесь реальных и придуманных фактов.
Технические характеристики. Параметры конкретных моделей техники, версии, совместимость.
Отдельная опасность: правдоподобная неточность
Хуже полной выдумки — частичная. Модель выдаёт текст, где девяносто процентов правда, а десять — искажение. Такое не бросается в глаза и проходит проверку невнимательного читателя.
Например, верно излагает содержание закона, но путает номер статьи. Верно описывает событие, но сдвигает дату на год. Верно передаёт суть исследования, но завышает цифру.
Именно поэтому нельзя проверять «на глазок». Проверять надо конкретные факты по конкретным источникам.
Что снижает риск
Первое и главное: давать материал. Ошибка возникает там, где модель достаёт из памяти. Если она работает по приложенному вами документу, риск падает на порядок.
Второе: включать поиск. Ответ со ссылками, которые вы можете открыть, проверяем. Но: проверяйте, что ссылки открываются и содержат то, что заявлено. Бывает, что ссылка настоящая, а утверждение из неё не следует.
Третье: прямо разрешать незнание. Формулировка «Если ты не уверен, так и напиши. Не придумывай» реально работает — она сдвигает поведение модели.
Четвёртое: спрашивать об уверенности. «Отметь, какие утверждения ты считаешь точными, а какие требуют проверки». Не идеально, но полезно.
Пятое: перекрёстная проверка. Задать тот же вопрос второй модели от другого разработчика. Если ответы совпали — вероятность выше. Если разошлись — сигнал тревоги.
Шестое: обратный вопрос. Получив ответ, спросите: «Разбери свой предыдущий ответ критически. Что в нём может быть неверно?» Модель нередко сама находит слабые места.
Как проверять: практический протокол
Не всё нужно проверять с одинаковым усердием. Вот работающая градация.
Если результат идёт только вам и цена ошибки низкая — беглый просмотр на здравый смысл.
Если результат идёт другим людям — проверить все имена, даты, числа и утверждения о фактах.
Если результат имеет юридические, финансовые или медицинские последствия — проверить каждое утверждение по первоисточнику и, при существенности, показать специалисту.
Если под результатом будет стоять ваша подпись — вы должны понимать каждое предложение и быть готовы его защищать. Если не можете объяснить своими словами — переписывайте.
Ещё одна ловушка: чрезмерная уверенность в тоне
Модель говорит одинаково уверенно и о том, что знает точно, и о том, что выдумала. У человека обычно есть маркеры сомнения: интонация, оговорки, «кажется», «если не ошибаюсь». У модели они появляются, только если специально попросить.
Это опасно, потому что мы, люди, читаем уверенность как признак компетентности. Эволюционно мы настроены доверять уверенному собеседнику.
Дисциплина, которую стоит выработать: отделять форму от содержания. Гладкость текста — свойство генератора, а не признак истинности. Каждый раз, когда вы ловите себя на мысли «как хорошо написано, наверняка правда», — это сигнал остановиться и проверить.
ЧАСТЬ IV. ПЕРВЫЕ ШАГИ: НАЧИНАЕМ ПОЛЬЗОВАТЬСЯ
Здесь заканчивается объяснение и начинается работа. Эта часть — самая практическая в книге. Читать её лучше не в кресле, а с телефоном или компьютером под рукой, выполняя описанное по ходу.
Глава 14. Ваши первые тридцать минут
Принцип: сначала действие, потом понимание
Есть искушение сначала всё изучить, а потом начать. С нейросетями это не работает. Понимание приходит из опыта взаимодействия, а не из чтения. Проверено на личном опыте.
Поэтому предлагаю простой протокол на тридцать минут. Не читайте дальше — сделайте.
Минуты 1—5: выбрать и открыть
Вам нужен один сервис. Не пять, один. Позже сравните, сейчас — один.
Если вы в России и хотите без сложностей — откройте Алису от Яндекса (алиса.яндекс.ру или приложение) либо GigaChat от Сбера (giga.chat или приложение). Оба работают напрямую, на русском, бесплатно на базовом уровне, оплата российскими картами.
Если у вас есть возможность использовать зарубежные сервисы — ChatGPT (chat.openai.com), Claude (claude.ai) или Gemini (gemini.google.com). Учтите: для регистрации может потребоваться зарубежный номер телефона и способ оплаты, а доступ из России ограничен и требует дополнительных решений, которые вы принимаете самостоятельно.
Подробное сравнение — в главах 15 и 16. Сейчас просто откройте что-нибудь.
Зарегистрируйтесь. Установите мобильное приложение — им вы будете пользоваться чаще, чем думаете.
Минуты 5—10: первый разговор ни о чём
Задача этого этапа — снять напряжение. Не пытайтесь сразу решать рабочую задачу.
Напишите что-нибудь такое:
Объясни мне, чем отличается прокрастинация от лени, простыми словами, за четыре предложения.
Придумай пять кличек для домашней кошки рыжего цвета с наглым характером.
Я умею готовить только яичницу. Научи меня одному блюду, которое произведёт впечатление на гостей, но не требует навыков.
Прочитайте ответ. Задайте уточняющий вопрос. Попросите короче. Попросите иначе.
Цель — почувствовать, что это разговор, а не поисковый запрос. В поиск вы вводите ключевые слова. Здесь вы говорите как человеку.
Минуты 10—20: реальная задача
Теперь возьмите что-то настоящее из своей жизни. Что угодно из этого списка:
Письмо, которое вы откладываете. Опишите ситуацию и попросите написать черновик.
Мне нужно написать письмо соседу сверху. Он постоянно на протяжении долгого времени работает дрелью, чем мне очень мешает. Я хочу решить вопрос, но не поссориться — мы живём рядом много лет. Напиши сообщение, вежливое, но недвусмысленное, до восьмидесяти слов. Дай два варианта: помягче и потвёрже.

