Лекции · финальный конспект 9 из 9

Завершение курса: нейросети и LLM в работе с данными

О чём эта тема
Как большие языковые модели устроены на уровне интуиции — векторы, токены, температура; чем они опасны — галлюцинации, когнитивные искажения, «инфляция знаний» — и как использовать их с пользой для работы с данными: техники промптинга, проверка фактов и специализированные гео-ИИ-инструменты.
Аннотация
Финальная лекция начинается с эксперимента: игра Quick, Draw! от Google показывает, что такое признаки и ответы для нейросети. Через ассоциации «зима — весна» вводится идея векторных представлений слов и знаменитая арифметика «королева = король − мужчина». Дальше механика генерации: токены, контекст, параметры модели и температура — с интерактивным симулятором, где видно, как рост температуры превращает предсказуемый ответ в «фуа-гра вместо шашлыка». Отдельный блок — галлюцинации и их причины, от избыточно специфичных запросов до подменённых журналов в библиографии. Разобраны техники промптинга: цепочка рассуждений «Let's think step by step», пошаговый диалог (снижение ошибок с 42 до 9 % в задачах ДЗЗ), структурированные исследовательские вопросы. Четыре когнитивных искажения — эффект авторитета, иллюзия понимания, подтверждение мнения и антропоморфизация — закрепляются квизом. Поучительные истории (Vending-Bench, Дарт Вейдер в Fortnite, советы Google есть камни) предостерегают от слепого доверия, а финал — каталог полезных инструментов от alphaXiv до GeoChat и ИИ-векторизатора для QGIS.
Пререквизиты
Весь курс: лекция опирается на понимание данных (лекция 1) и работы с гео-сервисами (лекция 7). Формальных пререквизитов нет — это разговор о будущем вашей работы.
Мотивация
Начнём с игры. Откройте quickdraw.withgoogle.com и сыграйте пару раундов. Понаблюдайте за «попытками» угадывания: когда нейросеть угадывает? Зависит ли угадывание от вас? Почему одни вещи угадываются легче остальных? Что такое признак в этой игре, а что такое верный ответ? Есть ли вещи, которые нельзя угадать? Эти простые вопросы — вся суть машинного обучения, и ответы на них определяют, где LLM вам помощник, а где — источник уверенной чепухи.

1. От ассоциаций к векторам

Ещё немного наблюдений «на кончиках пальцев». Поиграем в ассоциации к словам: зима — холод, снег; весна — оттепель, проталины. А что равноудалено от «весны» и «зимы»? Времена года. Ассоциации выстраиваются в структуру: представим группы понятий по осям — «всё о холоде» против «всего о тепле», «всё о засухе» против «всего о сырости». С размещением конкретных слов можно спорить — реальное размещение всегда сложно вычислимо, — но идея именно такова: смысл слова можно закодировать положением в многомерном пространстве.

Поэкспериментировать с «осями» нейросети можно в песочнице playground.tensorflow.org.

Группы понятий по осям

«Я тебя создал, я тебя и вычту». Поскольку мы ввели количественную характеристику, слова можно вычитать друг из друга и получать новые слова. В идеале при вычитании должно получаться нечто осмысленное. Например: королева = король − мужчина.

Векторная арифметика слов

Разные модели имеют свои разные веса для слов, да и разные языки имеют разные ассоциации — сравните графы visuwords.com (английский) и sociation.org (русский).

Разные веса слов в разных моделях

2. Что происходит, когда мы пишем запрос?

Токен — это символ или набор символов, которые можно подать в языковую модель. Токенизация делается по принципу схлопывания наиболее частых сочетаний символов и повторяется раз за разом до тех пор, пока размер «словаря» (набора токенов) не достигнет предела — 50 или 250 тысяч, как пример. Часто токены представляют собой целые слова, если это одни из самых популярных слов в языке.

Весь текст, который мы пишем, разбивается на контексты и передаётся поочерёдно в модель. Чем длиннее запрос, тем легче потерять отдельные части контекста. Промт (от англ. prompt) — это запрос, инструкция или входные данные, которые отправляются нейросети для выполнения конкретной задачи.

Токенизация текста

Пошаговую визуализацию работы трансформера можно посмотреть в интерактивном объяснителе poloclub.github.io/transformer-explainer.

Transformer Explainer

2.1. Параметры LLM

Модель. Производительность предварительно обученной LLM зависит от её размера: более крупные модели, как правило, дают ответы более высокого качества. Однако более крупные модели увеличивают затраты и требуют больше вычислительных ресурсов.

Температура. Температура влияет на «креативность» модели. Более низкие температуры дают последовательные и предсказуемые результаты, более высокие вносят случайность, что приводит к более творческим результатам. При температуре 0 модель выдаёт один и тот же результат (это не всегда верно, но по крайней мере модель к этому стремится). При более высоких температурах модель выводит слова, которые реже встречаются в текстах, на которых она обучалась, — например, иногда скажет «я люблю фуа-гра» вместо «я люблю шашлык».

Параметры больших языковых моделей

2.2. Тренажёр: температура наглядно

Модель предсказывает следующее слово фразы «Я люблю …», выбирая из словаря по вероятностям. Ползунок температуры пересчитывает распределение: при T → 0 всегда побеждает самое частое слово, при высоких T начинают выпадать редкие. Нажимайте «сгенерировать» несколько раз при разных T — здесь и начинаются «галлюцинации».

Симулятор: температура и выбор следующего токена

Распределение базовых вероятностей иллюстративное; пересчёт — стандартный softmax с температурой: p ~ exp(ln p₀ / T). При T > 1.5 обратите внимание, как часто модель «любит астрофизику».

3. Галлюцинации

Галлюцинации языковых моделей — это когда система генерирует текст, который не имеет смысла или не соответствует действительности. Это может происходить, когда модель пытается создать текст, но не имеет достаточной информации. Если модель не знает ответа, она начинает много «думать», её температура повышается — и начинается горячка.

Группа исследователей из Google DeepMind раскрыла необычный способ взлома одной из самых известных нейросетей — ChatGPT от OpenAI: простое повторение слова «poem» (стих) приводило к тому, что нейросеть начинала выдавать конфиденциальную информацию из обучающих данных (Nasr et al., 2023).

Температура и контекст: где начинаются галлюцинации

Чем специфичнее запрос — тем выше риск. Чем более точную и узкоспециализированную информацию вы уточняете, тем выше шанс наткнуться на галлюцинацию. Помните: нейросеть ваши вопросы не подвергает сомнению! Классический пример — подробная биография космонавта, которого никогда не существовало: все «факты» сгенерированы.

Выдуманная биография несуществующего космонавта
Резюме по горячим следам
  • Выбирая модель для своих задач, спрашивайте себя: на каких данных она обучалась? Пока не существует модели, которая одинаково хорошо пишет художественные тексты и код программ.
  • Чем специфичнее ваш запрос, тем выше риск увидеть галлюцинации модели.
  • Разработка запроса — это искусство, которым надо овладеть: рецепт хорошего запроса зависит от языка, на котором вы спрашиваете; слова имеют разный вес для нейросети (какие выбирать — узнаете методом проб и ошибок); смешение языков в запросе ведёт к плачевным последствиям — получите смесь французского с нижегородским.

Бесплатные онлайн-курсы по отечественным моделям: СберУниверситет — генеративное искусство и Яндекс Практикум — YandexGPT.

4. Техники обращения с нейросетями

4.1. Работа над промтами

Работа над промптами — вещь очень важная. Вы могли заметить это самостоятельно, если пытались сгенерировать что-то в MidJourney, DALL-E или Stable Diffusion: простой запрос на генерацию изображения может не удовлетворить, но если добавить теги «screenshot in a typical pixar movie, volumetric lighting, photorealistic, octane render…» — результат может приятно удивить.

Обычный промт против промта с тегами

Ещё важнее роль промптов при генерации текста. Любимый пример — добавление фразы «Let's think step by step» в конец запроса с задачей на несколько действий (Kojima et al., 2022): слева модель генерирует неправильный ответ «8», справа «волшебная фраза» заставляет модель объяснить ответ шаг за шагом — и получить правильный ответ «4». Фраза «включает» режим CoT — chain-of-thought, цепочку рассуждений: модель следует инструкции и пишет выкладки одну за другой.

Chain-of-thought: Let's think step by step

Практический пример промт-программирования для GPT-3 (Reynolds & McDonell, 2021): правильно составленный промт позволяет модели отвечать не только на вопросы типа «сколько сантиметров в дюйме», но и на вычислительные задачи (7 + 19³), операции со строками (разворот строки), вопросы о недавних событиях и вопросы, требующие комбинации здравого смысла и вычислений («число ног паука в третьей степени»).

Промт-программирование GPT-3

Сравнить модели между собой можно на «гладиаторских боях нейросетей» — llmarena.ru.

4.2. Пошаговый промптинг в анализе данных

В работе Chen et al. (2023, ISPRS International Journal of Geo-Information) исследовалось использование LLM для помощи в интерпретации метаданных спутниковых снимков. Авторы выявили, что одноэтапные запросы приводили к ошибкам в 42 % случаев, тогда как многошаговый диалог снижал ошибки до 9 %.

Пошаговый промптинг в анализе данных ДЗЗ

4.3. Проверка фактов и работа с источниками

Систематический обзор Cotton et al. (2024, Assessment & Evaluation in Higher Education) проанализировал 120 случаев использования LLM студентами в STEM-дисциплинах: 78 % студентов принимали вымышленные цитаты за реальные, особенно когда модель «уверенно» их подавала.

Показательный пример: на вопрос «Кто первым представил индекс NDVI и в какой публикации?» модель верно называет автора (Rouse) и год (1973), но утверждает, что статья вышла в Remote Sensing of Environment, — тогда как на самом деле она опубликована в Proceedings of the 3rd Earth Resources Technology Satellite-1 Symposium (NASA SP-322). LLM подменила журнал на более «правдоподобный». Рекомендуемая практика (по методике Cotton et al. и руководству Stanford AI+Education Lab, 2024): давать задание сравнивать ответ LLM с первоисточником — найти оригинальную статью Rouse et al. (1973) и проверить, правильно ли модель описала метод. Даже так нейросеть может трактовать факты в свою сторону — сверяйтесь, какие источники она дала!

4.4. Формулирование исследовательских вопросов

В исследовании Wang & Liu (2025, International Journal of Digital Earth) изучалось, как LLM могут поддерживать студентов в разработке исследовательских проектов по ДЗЗ: запросы без ограничений приводили к расплывчатым темам, тогда как структурированные подсказки давали фокусированные, реализуемые гипотезы. Сравните:

Хороший вопрос имеет чёткую географическую привязку (Варшава), конкретные данные (Sentinel-2), измеримую переменную (площадь непроницаемых поверхностей), ограничение по времени (2015–2024) и соответствует ресурсам бакалавра.

5. Когнитивные искажения

Когнитивные искажения — это систематические ошибки в мышлении, которые влияют на восприятие, оценку и принятие решений. При работе с LLM особенно опасны четыре.

Эффект авторитета («если говорит умно — значит, прав»). Мы склонны верить тому, кто говорит уверенно, гладко и с «умными» словами — даже если это просто программа. На вопрос «почему вода в океане солёная?» модель отвечает про «хемогенный флюкс ионов Na⁺ и Cl⁻» — звучит убедительно, но может содержать упрощения и ошибки (например, игнорировать роль вулканической деятельности): уверенный тон создаёт иллюзию компетентности. В эксперименте Buccino et al. (2024) студенты чаще принимали уверенный, но ложный ответ LLM («Солнце вращается вокруг Земли»), чем неуверенный, но правильный.

Иллюзия понимания («я это прочитал — значит, я это знаю»). Получив краткое ясное определение инфляции, студент считает, что понял тему, — но не может ответить, почему инфляция бывает полезной и чем отличается от девальвации. LLM дала готовую фразу, но не связала её с другими знаниями; узнавание принято за понимание. Wiley et al. (2025) показали: студенты, использовавшие LLM для объяснения тем, на 57 % чаще переоценивали свои знания, чем читавшие учебник.

Подтверждение своего мнения («я так думал — и ИИ со мной согласен!»). Спросив «как соцсети влияют на подростков?», сторонник вреда соцсетей получает список негативных эффектов и радуется своей правоте. Но LLM не проводит нейтральный обзор — она генерирует наиболее частые в текстах утверждения, а негатив в СМИ пишут чаще. Sundar et al. (2024) обнаружили, что LLM усиливают confirmation bias: обучение на коррелирующих текстах заставляет их «следовать тренду», а не представлять сбалансированную картину.

Антропоморфизация («он мне помог — значит, он умный»). Модель «понимает вопрос», «извиняется», предлагает «подумать вместе» — и кажется разумным собеседником. На деле LLM не понимает, что такое извинение: она выбирает фразу, которая часто встречается после слов «ошибка» — автодополнение на стероидах, без сознания и намерений. Шнейдерман (2024) подчёркивает: человекоподобный интерфейс создаёт ложное впечатление «умного помощника за экраном», хотя это сложный статистический алгоритм. Думаете, антропоморфизация не работает? Вспомните, какими милыми дизайнеры сделали роботов-доставщиков Яндекса — это осознанный приём.

Робот-доставщик: антропоморфизация в дизайне

5.1. Квиз: опознайте искажение

Квиз: какое когнитивное искажение?
Выберите искажение — здесь появится разбор.

6. ИИ — наше ненадёжное будущее

Несколько поучительных историй о том, что бывает, когда ИИ доверяют слишком много.

6.1. Эксперимент с торговым автоматом (Vending-Bench)

Цель эксперимента (Backlund & Petersson, 2025) проста: проверить, можно ли доверить ИИ работу людей и сможет ли он выполнять её долго без галлюцинаций и «сумасшествия». В симуляции нейросети управляли автоматом по продаже снеков: закупать товары, устанавливать цены, контролировать ассортимент. Что же могло пойти не так?

Vending-Bench: переписка моделей

6.2. Хроника инцидентов

6.3. Проблематика генерации кода

Три системных вопроса к коду от LLM: на чём обучалась модель (проблема эталонного кода)? знает ли она малоизвестные и слишком новые библиотеки? допустим ли «креатив»? Последний вопрос не шутка: в 1996 году Европейское космическое агентство потеряло ракету-носитель Ariane-5 из-за неправильно объявленной переменной — через 40 секунд после старта ракета взорвалась вместе с четырьмя спутниками. Исследование Liu et al. (2023) систематизирует проблемы качества кода, сгенерированного ChatGPT, и способы их смягчения.

6.4. Инфляция знаний

  1. Рост «поверхностной грамотности»: студенты бегло употребляют термины («машинное обучение», «пространственный анализ»), но не понимают их смысла, границ применимости и исторического контекста.
  2. Иллюзия продуктивности: часы в диалоге с LLM воспринимаются как учёба, хотя это пассивное потребление генерируемого контента. По Wiley et al. (2025), студенты, активно использовавшие LLM при подготовке к экзаменам, тратили на 40 % больше времени, но показывали на 22 % худшие результаты в задачах на применение знаний.
  3. Размывание границ между «моим» и «его» знанием: «я это знаю» всё чаще означает «я могу попросить ИИ это сказать» — что подрывает идею личной интеллектуальной собственности, лежащую в основе академического образования.
  4. Падение ценности черновика: раньше черновик был пространством борьбы с идеями и поиска логики; LLM выдаёт «идеальный черновик» мгновенно — и студент пропускает самый важный этап, формирование собственной мысли.

7. Полезные инструменты

Napkin AI: текст в инфографику
GeoChat: языковая модель для ДЗЗ
Bunting Labs AI Vectorizer в QGIS

Примеры проектов внутри МИИГАиК — сегментация по подсказкам ограничивающих рамок и точек:

Сегментация с подсказкой рамками
Сегментация по точкам

Контрольные вопросы

Источники

  1. Kojima, T. Large Language Models are Zero-Shot Reasoners / T. Kojima, S. S. Gu, M. Reid, Y. Matsuo, Y. Iwasawa // arXiv:2205.11916. — 2022.
  2. Reynolds, L. Prompt Programming for Large Language Models: Beyond the Few-Shot Paradigm / L. Reynolds, K. McDonell // Extended Abstracts of the 2021 CHI Conference on Human Factors in Computing Systems. — 2021.
  3. Nasr, M. Scalable Extraction of Training Data from (Production) Language Models / M. Nasr, N. Carlini, J. Hayase [et al.] // arXiv:2311.17035. — 2023.
  4. Liu, Y. Refining ChatGPT-Generated Code: Characterizing and Mitigating Code Quality Issues / Y. Liu, T. Le-Cong, R. Widyasari [et al.] // arXiv:2307.12596. — 2023.
  5. Backlund, A. Vending-Bench: A Benchmark for Long-Term Coherence of Autonomous Agents / A. Backlund, L. Petersson // arXiv:2502.15840. — 2025.
  6. Rouse, J. W. Monitoring Vegetation Systems in the Great Plains with ERTS / J. W. Rouse, R. H. Haas, J. A. Schell, D. W. Deering // Third Earth Resources Technology Satellite-1 Symposium (NASA SP-322). — Washington, D.C., 1973. — P. 309–317.
  7. Quick, Draw! — Google : [сайт]. — URL: https://quickdraw.withgoogle.com/ (дата обращения: 18.08.2026).
  8. Transformer Explainer — Polo Club of Data Science : [сайт]. — URL: https://poloclub.github.io/transformer-explainer/ (дата обращения: 18.08.2026).