Нейросети для работы. Книга-тренажёр
Нейросети для работы. Книга-тренажёр

Полная версия

Нейросети для работы. Книга-тренажёр

Язык: Русский
Год издания: 2026
Добавлена:
Настройки чтения
Размер шрифта
Высота строк
Поля
На страницу:
2 из 5

Теперь о механизме, который делает токены не просто набором фрагментов, а осмысленный текст. Этот механизм называется Attention, что на русский переводится как «механизм внимания», и он является архитектурным ядром всех современных LLM, то есть Large Language Models, больших языковых моделей. Суть его в следующем: когда модель обрабатывает последовательность токенов, она не читает их строго по порядку, как это делает человек. Вместо этого каждый токен «оглядывается» на все остальные токены в контексте и присваивает им весовые коэффициенты значимости. Грубо говоря, если в вашем тексте есть фраза «Компания подписала контракт с поставщиком, потому что он предложил лучшую цену», модель должна понять, что местоимение «он» относится к «поставщику», а не к «компании». Механизм внимания решает именно эту задачу: он определяет, на какие предшествующие токены текущему токену нужно «обратить внимание» при генерации следующего. Чем больше параметров у модели, тем более сложные и дальние связи она способна уловить. И именно поэтому большая модель лучше понимает контекст, чем маленькая: у неё больше «голов внимания», то есть параллельных каналов, по которым она одновременно отслеживает разные типы связей в тексте.

Из механизма внимания напрямую вытекает понятие контекстного окна. Контекстное окно — это максимальное количество токенов, которое модель способна удерживать в «оперативной памяти» при обработке одного запроса. Всё, что не помещается в это окно, для модели просто не существует: она этого не видит, не помнит и не учитывает. Современные модели предлагают контекстное окно от восьми тысяч токенов у компактных решений до ста двадцати восьми тысяч и даже миллиона токенов у флагманских систем. Восемь тысяч токенов — это примерно шесть тысяч слов, или двадцать-двадцать пять страниц текста. Сто двадцать восемь тысяч токенов — это уже полноценная книга объёмом триста-четыреста страниц. Почему это важно? Потому что если вы загрузите в модель документ на пятьдесят страниц, а контекстное окно рассчитано на двадцать, модель обработает только начало и конец, а середина окажется в так называемой «слепой зоне». Это явление исследователи назвали эффектом «lost in the middle», то есть «потерянный в середине»: модель уверенно отвечает на вопросы по первым и последним абзацам, но начинает путаться и галлюцинировать, когда вопрос касается информации из центральной части документа. Подробно мы разберём стратегии борьбы с этим эффектом в четвёртой главе, а пока запомните: чем больше документ, тем внимательнее нужно подходить к выбору модели и к способу подачи информации.

С контекстным окном тесно связаны два практических ограничения, которые бьют по вашему кошельку и по вашему терпению. Первое — стоимость запросов. Если вы работаете через облачный API, то есть через программный интерфейс, который позволяет отправлять запросы к модели из собственной программы или скрипта, вы платите за каждый токен: и за входной, то есть за ваш промпт и загруженные документы, и за выходной, то есть за сгенерированный ответ. Входные токены обычно стоят дешевле выходных, примерно в два-четыре раза, но если вы загружаете в контекст большой документ, входных токенов становится много, и счёт растёт. Второе ограничение — скорость генерации. Модель генерирует текст не целиком, а токен за токеном, последовательно. Каждый следующий токен зависит от предыдущего, поэтому ускорить процесс в разы невозможно. Типичная скорость для облачных сервисов составляет тридцать-восемьдесят токенов в секунду, а для локальных моделей на домашнем компьютере — пять-пятнадцать токенов в секунду. Если вам нужен ответ на две тысячи токенов, при скорости сорок токенов в секунду вы будете ждать около пятидесяти секунд. Это не критично для одного запроса, но если вы строите конвейер из десятков последовательных запросов, время складывается, и вы начинаете ценить каждую оптимизацию.

Следующий параметр, без понимания которого вы не сможете управлять качеством генерации, называется Temperature, то есть «температура». Это число от нуля до двух, которое определяет степень случайности при выборе следующего токена. Представьте, что модель на каждом шаге имеет список из нескольких подходящих продолжений фразы, каждое с определённой вероятностью. При температуре ноль модель всегда выбирает самый вероятный вариант, и ответ становится максимально предсказуемым, детерминированным, но при этом сухим и однообразным. При температуре около нуля целых семи — единицы, что является значением по умолчанию для большинства сервисов, модель иногда выбирает второй или третий по вероятности вариант, и текст становится живее, разнообразнее, но при этом чуть менее точным. При температуре выше полутора модель начинает активно выбирать маловероятные токены, и текст превращается в креативный поток, который может быть гениальным, а может быть полной бессмылицей. Практическое правило звучит так: для аналитических задач, извлечения данных, суммаризации документов ставьте температуру ноль — ноль целых три десятых, потому что вам нужна точность, а не красота. Для написания маркетинговых текстов, мозговых штурмов, генерации идей поднимайте до нуля семи — единицы. Для художественных экспериментов и нестандартных задач можно рискнуть с единицей и двумя, но будьте готовы к тому, что половину результатов придётся выбросить.

И последнее теоретическое понятие этой главы, которое станет сквозным для всей книги: нативная мультимодальность. Ранние языковые модели работали исключительно с текстом: вы вводили слова, получали слова. Современные модели, такие как Qwen 2.5, YandexGPT и другие флагманы, изначально обучаются на данных разных типов: на тексте, на изображениях, на аудио, а некоторые — и на видео. Слово «нативная» здесь означает, что модель не использует отдельные модули для распознавания картинок и звука с последующей передачей результата в текстовый блок. Вместо этого все типы данных кодируются в единое пространство токенов на самом раннем этапе обработки. Изображение разбивается на визуальные токены, аудио — на звуковые, и далее механизм внимания работает с ними точно так же, как с текстовыми. Для вас это означает, что вы можете загрузить в один запрос фотографию накладной, голосовую заметку с совещания и текстовый вопрос «Сравни данные на фото с тем, что сказал спикер», и модель обработает всё в рамках одного контекстного окна. Это радикально расширяет спектр задач, которые можно делегировать ИИ, и мы будем подробно разбирать мультимодальные сценарии начиная с четырнадцатой главы.

Реальный кейс

Теория теорией, но ничто не отрезвляет так, как чужой счёт на крупную сумму. В две тысячи двадцать третьем году одна крупная международная IT-корпорация, имя которой по понятным причинам я не называю, но масштаб которой вы можете представить по количеству сотрудников в сотни тысяч человек, решила обучить собственную языковую модель на внутренних данных. Задача звучала разумно: собрать корпоративную базу знаний, загрузить её через API в обучающий конвейер и получить модель, которая понимает специфику компании. Команда инженеров подготовила датасет объёмом двенадцать гигабайт и отправила его на обработку. Проблема была в том, что датасет не прошёл предварительную фильтрацию: в нём содержались тысячи дублирующихся документов, идентичные фрагменты из разных версий одних и тех же файлов, повторяющиеся абзацы из архивных переписок. Инженеры не применили то, что в этой книге мы будем называть чанкингом, то есть предварительным разбиением большого массива данных на логические фрагменты с удалением дубликатов и оценкой объёма в токенах перед отправкой. Результат оказался катастрофическим: за семьдесят два часа непрерывной обработки API нагенерировал счёт на сорок одну тысячу двести долларов. Не тысяч долларов — сорок одну тысячу. Причём обнаружилось это не сразу, а когда финансовый департамент получил инвойс и передал его в техническую команду с вопросом, что, собственно, произошло. Разбор показал, что из двенадцати гигабайт уникальной информации было от силы три с половиной, остальное — дубликаты, которые модель обрабатывала заново, потребляя токены и деньги. Урок здесь двойной. Первый: любой большой объём данных перед загрузкой в модель или в обучающий конвейер необходимо подвергать чанкингу, то есть разбиению на фрагменты с оценкой уникальности. Второй: перед массовым запросом через API всегда устанавливайте лимит расходов, то есть максимальную сумму, по достижении которой система автоматически останавливает генерацию. Оба этих правила мы будем применять на практике в каждой последующей главе, где речь пойдёт о работе с документами.

Инструкция

Теперь перейдём к тому, что вы будете делать каждый раз, садясь за работу с моделью. Я называю это чек-листом настройки параметров генерации, и он состоит из пяти пунктов, которые нужно пройтись перед отправкой первого запроса. Пункт первый: определите объём входных данных в токенах и убедитесь, что он укладывается в контекстное окно выбранной модели с запасом минимум в двадцать процентов на выходной ответ. Пункт второй: выберите температуру в зависимости от типа задачи — ноль для аналитики, ноль семь для текстов, выше единицы для креатива. Пункт третий: если работаете через API, установите дневной или месячный лимит расходов, чтобы избежать ситуации из кейса выше. Пункт четвёртый: решите, нужна ли вам потоковая генерация, то есть вывод токенов по мере их появления, или пакетная, когда вы получаете весь ответ целиком. Для интерактивной работы с чатом потоковая удобнее, для конвейеров и скриптов — пакетная. Пункт пятый: если задача мультимодальная, проверьте, что выбранный сервис поддерживает нужный тип входных данных — изображения, аудио или видео — нативно, а не через внешнюю надстройку.

А теперь о выборе модели. В этой книге мы работаем с конкретным набором инструментов, и я объясню логику выбора для каждого из них, чтобы вы не гадали, а понимали, почему для конкретной задачи берёте именно этот инструмент. YandexGPT — это семейство моделей от Яндекса, доступное через облачный сервис и через API. Его сильные стороны: отличная работа с русским языком, понимание российских реалий и контекста, интеграция с экосистемой Яндекса, включая поиск и корпоративные сервисы. Контекстное окно в последних версиях достигает ста двадцати восьми тысяч токенов. Лучше всего подходит для суммаризации документов на русском, написания деловых текстов, анализа данных из российских источников. GigaChat от Сбера — аналогичный облачный сервис с акцентом на корпоративный сегмент. Его преимущество в том, что Сбер предлагает развёртывание на собственной инфраструктуре заказчика, то есть в закрытом контуре, что критично для банков, госсектора и компаний с жёсткими требованиями к хранению данных. Контекстное окно сопоставимо с конкурентами, качество русского языка высокое. Salute — это линейка моделей от Сбера, ориентированная на голосовые сценарии и мультимодальные задачи. Если вам нужен не просто текстовый ответ, а работа с аудио или интеграция в голосового агента, Salute будет естественным выбором, потому что модель изначально обучалась на аудиоданных. Илья — модель от компании-разработчика «Сколково» и партнёров, заточенная под задачи программирования и технической документации. Если ваша работа связана с кодом, техническими спецификациями или архитектурными описаниями, Илья даст более точный результат, чем универсальные модели, потому что обучалась преимущественно на технических корпусах.

Перейдём к открытым моделям, которые можно развёртывать локально. DeepSeek-V3 — это открытая модель от китайской лаборатории DeepSeek, доступная для свободного скачивания и запуска на собственных серверах. Её сильная сторона — рассуждение, то есть способность выстраивать цепочки логических шагов при решении аналитических задач. Она хорошо справляется с математикой, анализом данных, написанием структурированных отчётов. Контекстное окно — сто двадцать восемь тысяч токенов. DeepSeek-R1 — специализированная версия той же лаборатории, оптимизированная именно для многошагового рассуждения. Если вам нужно, чтобы модель не просто дала ответ, а показала ход мысли, проверила сама себя и выдала обоснованный вывод, R1 предпочтительнее. Qwen 2.5 и Qwen 3 — линейка от китайской компании Alibaba. Qwen 2.5 — рабочая лошадка с отличным балансом скорости и качества, поддерживает мультимодальный вход, то есть понимает изображения. Qwen 3 — более свежая версия с улучшенным механизмом внимания и расширенным контекстным окном. Обе модели распространяются под открытой лицензией, что позволяет разворачивать их на своей инфраструктуре без лицензионных отчислений. Yi-34B — модель от лаборатории 01.AI с тридцатью четырьмя миллиардами параметров. Цифра в названии как раз и означает количество миллиардов параметров, и чем их больше, тем сложнее задачи модель способна решать. Yi-34B хорошо подходит для задач, требующих глубокого понимания контекста на нескольких языках одновременно. Наконец, Ollama — это не модель, а среда запуска. Это бесплатная программа, которую вы устанавливаете на свой компьютер и через которую запускаете любую из перечисленных открытых моделей локально, без интернета, без передачи данных в облако. Если ваши данные относятся к красному уровню защиты, о котором мы говорили во введении, Ollama или аналогичная среда LM Studio — единственный допустимый вариант.

Логика выбора, если свести её к простому правилу, звучит так. Для быстрых рабочих задач на русском языке в браузере — YandexGPT или GigaChat. Для голосовых сценариев — Salute или Yandex SpeechKit. Для кода и технической документации — Илья или DeepSeek-V3. Для сложной аналитики с многошаговым рассуждением — DeepSeek-R1 или Qwen 3. Для задач, где данные нельзя выводить за пределы компании, — любая открытая модель через Ollama или LM Studio. Для мультимодальных задач с изображениями — Qwen 2.5 или Qwen 3. Для задач с аудио — Salute или связка Yandex SpeechKit плюс текстовая модель. Не существует одной идеальной модели на все случаи жизни, и тот, кто пытается работать только с одним сервисом, неизбежно упирается в потолок. Ваша задача как автономного сотрудника — собрать из двух-трёх инструментов связку, которая закрывает именно ваши процессы.

Практика. Базовый уровень. Упражнение «Токеновый аудит»

Настало время оторваться от чтения и сделать что-то руками. Откройте любой из перечисленных сервисов — YandexGPT, GigaChat или, если хотите работать без интернета, установите Ollama и загрузите модель Qwen 2.5. Ваша задача на ближайшие пятнадцать минут — провести токеновый аудит своего типичного рабочего дня. Возьмите три документа, с которыми вы работаете регулярно: это может быть служебная записка, фрагмент переписки, выдержка из отчёта или техническое задание. Скопируйте каждый текст в сервис-токенайзер, то есть в любой онлайн-инструмент для подсчёта токенов, либо вставьте текст в чат модели и попросите: «Сколько токенов в этом тексте?» Запишите результат для каждого документа. Теперь оцените: если бы вам нужно было загрузить все три документа одновременно в один запрос к модели, хватило бы контекстного окна? А если добавить к ним ваш вопрос и ожидаемый ответ? Это и есть аудит: вы впервые посмотрели на свои рабочие материалы не как на «страницы текста», а как на токены, то есть на ресурс, который расходуется и стоит денег. Результат упражнения запишите в чек-лист прогресса: какие документы вы брали, сколько токенов каждый занял, уложились ли они в контекстное окно и какой запас остался. Если вы обнаружили, что типичный документ занимает восемьдесят процентов контекстного окна модели, которую вы используете, это сигнал: либо выбирайте модель с окном побольше, либо учитесь разбивать документ на части, о чём мы подробно поговорим в четвёртой главе.

Практика. Продвинутый уровень. Упражнение «Выбери модель»

Если вы уже уверенно работаете с одним-двумя сервисами и хотите расширить инструментарий, это задание для вас. Вам понадобится тридцать-сорок минут и доступ минимум к двум моделям из перечисленных выше. Возьмите одну конкретную рабочую задачу, которую вам приходится решать регулярно: например, суммаризация протокола совещания, написание ответного письма клиенту, анализ конкурента или составление технического задания. Сформулируйте один и тот же промпт, то есть один и тот же запрос, и отправьте его последовательно в две разные модели. Например, в YandexGPT и в DeepSeek-V3, или в GigaChat и в Qwen 2.5. Сравните результаты по четырём критериям: точность фактов, полнота ответа, стиль и формат, время генерации. Запишите наблюдения в чек-лист прогресса. Теперь измените температуру: в одной модели поставьте ноль, в другой ноль семь, и отправьте тот же промпт. Посмотрите, как изменился результат. Вы наглядно увидите, что температура ноль даёт сухой, но точный ответ, а ноль семь — более живой, но с риском мелких неточностей. Цель упражнения не в том, чтобы найти «лучшую модель», а в том, чтобы вы почувствовали разницу и научились осознанно выбирать инструмент под задачу, а не хватать первый попавшийся. К концу этого упражнения у вас в чек-листе прогресса должна появиться запись: «Для задачи Х лучше подходит модель Y с температурой Z, потому что…» Именно так формируется навык автономного сотрудника: не запоминание рецептов, а понимание логики выбора.

На этом первая глава завершена. Вы узнали, что модель работает с токенами, а не со словами; что механизм внимания определяет качество понимания контекста; что контекстное окно ограничивает объём данных в одном запросе; что температура управляет балансом между точностью и креативностью; что нативная мультимодальность позволяет загружать в модель картинки, звук и видео наравне с текстом. Вы увидели, к чему приводит пренебрежение чанкингом, и научились выбирать модель под конкретную задачу. В следующей главе мы разберём обратную сторону медали: что происходит, когда модель уверенно выдаёт вам неправду, как эту неправду распознать и какие механизмы защиты выстроить, чтобы никогда не попасть в ситуацию адвоката, который подал в суд апелляцию с вымышленными прецедентами.

Глава 2. Борьба с галлюцинациями и архитектурные лимиты моделей

Теория

В первой главе мы разобрались, что языковая модель не «понимает» текст в человеческом смысле, а предсказывает следующий токен на основе статистических вероятностей. Из этого фундаментального свойства архитектуры вытекает главная проблема, с которой вы будете сталкиваться ежедневно: галлюцинации. Галлюцинация в контексте искусственного интеллекта — это уверенно сгенерированный, грамматически безупречный, но фактически недостоверный или полностью вымышленный ответ. Почему это происходит? Потому что модель не имеет доступа к базе истин, у неё есть только карта вероятностей. Когда вы задаёте вопрос, на который у модели нет точного ответа в её тренировочных данных, она не может сказать «я не знаю» по умолчанию — её математическая задача заключается в том, чтобы выдать наиболее правдоподобное продолжение диалога. В результате она начинает экстраполировать, склеивая реальные факты с вымышленными именами, датами или цитатами. Понимание этой природы критически важно: вы должны относиться к любому сгенерированному тексту не как к истине, а как к черновику, требующему верификации.

Чтобы минимизировать риск галлюцинаций, нужно учитывать архитектурный ландшафт современных моделей и их специализацию. Отечественные решения, такие как YandexGPT и GigaChat, обучались на массивах, включающих российское законодательство, локальные бизнес-реалии и отечественные энциклопедические данные. Если вам нужно написать претензию по закону о защите прав потребителей или проанализировать рыночный отчёт по российскому ритейлу, эти модели будут галлюцинировать значительно реже, чем их западные или азиатские аналоги, просто потому что их «карта вероятностей» точнее отражает вашу реальность. В то же время открытые модели вроде DeepSeek-V3 или Qwen 3 демонстрируют выдающиеся результаты в структурном мышлении, программировании и математике, поскольку их разработчики делали упор на логику и рассуждения. Если вы попросите YandexGPT написать сложный скрипт на Python, а DeepSeek составить исковое заявление в арбитражный суд Москвы, обе модели с высокой долей вероятности допустят фактические или логические ошибки именно из-за выхода за пределы своей сильной стороны. Выбор правильного инструмента под конкретную задачу — это первый и самый дешёвый способ защиты от нейросетевой лжи.

Особую опасность представляют мультимодальные галлюцинации, то есть искажения в работе с изображениями, аудио и видео. Почему они опаснее текстовых? Дело в человеческой психологии и так называемом сенсорном доверии. Когда мы читаем текст, сгенерированный машиной, наш мозг по умолчанию включает критический фильтр: мы подсознательно допускаем, что автор мог ошибиться. Но когда мы видим фотографию или слышим аудиозапись, эволюция заставляет нас доверять органам чувств гораздо сильнее. Если мультимодальный агент анализирует снимок производственного брака и «дорисовывает» в своём описании трещину, которой на самом деле нет, или транскрибирует зашумлённую запись совещания, вставляя в протокол слово, которое никто не произносил, руководитель с гораздо большей вероятностью подпишет такой документ не глядя. Мультимодальная модель может уверенно описать несуществующий объект на картинке или приписать спикеру интонацию и слова, которых не было, просто потому что статистически в подобном контексте они часто встречаются. Именно поэтому работа с любыми нетекстовыми данными требует ещё более жёстких протоколов проверки, о которых мы поговорим в блоке инструкций.

Реальный кейс

Чтобы вы не думали, что галлюцинации — это лишь мелкие помарки в невинных эссе, давайте разберём прецедент, который заставил юридическое сообщество всего мира в панике переписывать внутренние регламенты. В две тысячи двадцать третьем году американский адвокат Стивен Шварц готовил апелляционную жалобу в федеральный суд. Чтобы усилить позицию клиента, он попросил популярный ИИ-чат-бот найти судебные прецеденты, подтверждающие его аргументы. Модель выдала шесть идеальных, кристально логичных прецедентов с указанием номеров дел, фамилий судей, дат и даже развёрнутыми цитатами из решений. Стивен Шварц включил их в официальный документ и подал в суд. Когда судья попросил предоставить копии этих решений, адвокат снова обратился к ИИ, и тот сгенерировал тексты самих судебных актов, которые выглядели абсолютно аутентично. Проблема выяснилась только тогда, когда клерки суда начали искать дела в базе и не нашли ни одного из них. Все шесть прецедентов, все цитаты и все номера дел были стопроцентной галлюцинацией. Суд назначил адвокату персональный штраф, опубликовал решение в открытом доступе с жёсткой критикой, а сам юрист столкнулся с дисциплинарными разбирательствами и потерей части клиентской базы.

Этот случай стал триггером: на текущий момент зафиксировано более четырнадцати аналогичных инцидентов в разных юрисдикциях, где юристы, учёные и корпоративные секретари слепо доверяли сгенерированным ссылкам на научные статьи или нормативные акты. Урок здесь предельно жёсткий: модель не знает, что она лжёт. Для неё вымышленный судебный прецедент и реальный закон о налогах — это просто последовательности токенов, которые статистически хорошо сочетаются со словом «апелляция». В корпоративной среде это означает, что любой документ, выходящий из-под пера ИИ-ассистента и имеющий юридические, финансовые или репутационные последствия, должен проходить через процедуру, которую я называю презумпцией виновности. Мы изначально считаем любой факт, цифру, ссылку или цитату вымышленными, пока не доказано обратное. Если вы не готовы потратить время на доказательство, вы не имеете права использовать ИИ для этой задачи.

Инструкция

Чтобы внедрить презумпцию виновности в ежедневную работу без паралича анализа, я разработал алгоритм верификации, который называю Тройное сито. Это последовательность из трёх фильтров, через которые должен проходить любой значимый результат генерации. Первое сито — это сито внутренней непротиворечивости. Вы читаете сгенерированный текст и ищете логические конфликты внутри самого документа: не утверждает ли модель в первом абзаце, что рынок растёт, а в третьем делает вывод о необходимости сокращения штата из-за падения спроса? Второе сито — это сито внешнего источника. Каждый конкретный факт, дату, имя собственное или номер закона вы должны иметь возможность подтвердить через независимый канал: поисковую систему, внутреннюю базу знаний компании или официальный реестр. Если модель дала ссылку на статью или закон, вы обязаны кликнуть по ней или скопировать название и найти первоисточник вручную, потому что ИИ отлично умеет генерировать правдоподобные, но мёртвые URL-адреса. Третье сито — это сито здравого смысла, или проверка на абсурдность. Вы задаёте себе вопрос: «Если бы этот факт был правдой, знал бы я об этом из новостей или отраслевых каналов?». Часто модель генерирует сенсационные, но физически невозможные события, и простая опора на ваш профессиональный опыт позволяет отсечь их за секунды.

На страницу:
2 из 5