Завершение курса: нейросети и LLM в работе с данными
- О чём эта тема
- Как большие языковые модели устроены на уровне интуиции — векторы, токены, температура; чем они опасны — галлюцинации, когнитивные искажения, «инфляция знаний» — и как использовать их с пользой для работы с данными: техники промптинга, проверка фактов и специализированные гео-ИИ-инструменты.
- Аннотация
- Финальная лекция начинается с эксперимента: игра Quick, Draw! от Google показывает, что такое признаки и ответы для нейросети. Через ассоциации «зима — весна» вводится идея векторных представлений слов и знаменитая арифметика «королева = король − мужчина». Дальше механика генерации: токены, контекст, параметры модели и температура — с интерактивным симулятором, где видно, как рост температуры превращает предсказуемый ответ в «фуа-гра вместо шашлыка». Отдельный блок — галлюцинации и их причины, от избыточно специфичных запросов до подменённых журналов в библиографии. Разобраны техники промптинга: цепочка рассуждений «Let's think step by step», пошаговый диалог (снижение ошибок с 42 до 9 % в задачах ДЗЗ), структурированные исследовательские вопросы. Четыре когнитивных искажения — эффект авторитета, иллюзия понимания, подтверждение мнения и антропоморфизация — закрепляются квизом. Поучительные истории (Vending-Bench, Дарт Вейдер в Fortnite, советы Google есть камни) предостерегают от слепого доверия, а финал — каталог полезных инструментов от alphaXiv до GeoChat и ИИ-векторизатора для QGIS.
- Пререквизиты
- Весь курс: лекция опирается на понимание данных (лекция 1) и работы с гео-сервисами (лекция 7). Формальных пререквизитов нет — это разговор о будущем вашей работы.
- Мотивация
- Начнём с игры. Откройте quickdraw.withgoogle.com и сыграйте пару раундов. Понаблюдайте за «попытками» угадывания: когда нейросеть угадывает? Зависит ли угадывание от вас? Почему одни вещи угадываются легче остальных? Что такое признак в этой игре, а что такое верный ответ? Есть ли вещи, которые нельзя угадать? Эти простые вопросы — вся суть машинного обучения, и ответы на них определяют, где LLM вам помощник, а где — источник уверенной чепухи.
1. От ассоциаций к векторам
Ещё немного наблюдений «на кончиках пальцев». Поиграем в ассоциации к словам: зима — холод, снег; весна — оттепель, проталины. А что равноудалено от «весны» и «зимы»? Времена года. Ассоциации выстраиваются в структуру: представим группы понятий по осям — «всё о холоде» против «всего о тепле», «всё о засухе» против «всего о сырости». С размещением конкретных слов можно спорить — реальное размещение всегда сложно вычислимо, — но идея именно такова: смысл слова можно закодировать положением в многомерном пространстве.
Поэкспериментировать с «осями» нейросети можно в песочнице playground.tensorflow.org.
«Я тебя создал, я тебя и вычту». Поскольку мы ввели количественную характеристику, слова можно вычитать друг из друга и получать новые слова. В идеале при вычитании должно получаться нечто осмысленное. Например: королева = король − мужчина.
Разные модели имеют свои разные веса для слов, да и разные языки имеют разные ассоциации — сравните графы visuwords.com (английский) и sociation.org (русский).
2. Что происходит, когда мы пишем запрос?
Токен — это символ или набор символов, которые можно подать в языковую модель. Токенизация делается по принципу схлопывания наиболее частых сочетаний символов и повторяется раз за разом до тех пор, пока размер «словаря» (набора токенов) не достигнет предела — 50 или 250 тысяч, как пример. Часто токены представляют собой целые слова, если это одни из самых популярных слов в языке.
Весь текст, который мы пишем, разбивается на контексты и передаётся поочерёдно в модель. Чем длиннее запрос, тем легче потерять отдельные части контекста. Промт (от англ. prompt) — это запрос, инструкция или входные данные, которые отправляются нейросети для выполнения конкретной задачи.
Пошаговую визуализацию работы трансформера можно посмотреть в интерактивном объяснителе poloclub.github.io/transformer-explainer.
2.1. Параметры LLM
Модель. Производительность предварительно обученной LLM зависит от её размера: более крупные модели, как правило, дают ответы более высокого качества. Однако более крупные модели увеличивают затраты и требуют больше вычислительных ресурсов.
Температура. Температура влияет на «креативность» модели. Более низкие температуры дают последовательные и предсказуемые результаты, более высокие вносят случайность, что приводит к более творческим результатам. При температуре 0 модель выдаёт один и тот же результат (это не всегда верно, но по крайней мере модель к этому стремится). При более высоких температурах модель выводит слова, которые реже встречаются в текстах, на которых она обучалась, — например, иногда скажет «я люблю фуа-гра» вместо «я люблю шашлык».
2.2. Тренажёр: температура наглядно
Модель предсказывает следующее слово фразы «Я люблю …», выбирая из словаря по вероятностям. Ползунок температуры пересчитывает распределение: при T → 0 всегда побеждает самое частое слово, при высоких T начинают выпадать редкие. Нажимайте «сгенерировать» несколько раз при разных T — здесь и начинаются «галлюцинации».
Распределение базовых вероятностей иллюстративное; пересчёт — стандартный softmax с температурой: p ~ exp(ln p₀ / T). При T > 1.5 обратите внимание, как часто модель «любит астрофизику».
3. Галлюцинации
Галлюцинации языковых моделей — это когда система генерирует текст, который не имеет смысла или не соответствует действительности. Это может происходить, когда модель пытается создать текст, но не имеет достаточной информации. Если модель не знает ответа, она начинает много «думать», её температура повышается — и начинается горячка.
Группа исследователей из Google DeepMind раскрыла необычный способ взлома одной из самых известных нейросетей — ChatGPT от OpenAI: простое повторение слова «poem» (стих) приводило к тому, что нейросеть начинала выдавать конфиденциальную информацию из обучающих данных (Nasr et al., 2023).
Чем специфичнее запрос — тем выше риск. Чем более точную и узкоспециализированную информацию вы уточняете, тем выше шанс наткнуться на галлюцинацию. Помните: нейросеть ваши вопросы не подвергает сомнению! Классический пример — подробная биография космонавта, которого никогда не существовало: все «факты» сгенерированы.
- Выбирая модель для своих задач, спрашивайте себя: на каких данных она обучалась? Пока не существует модели, которая одинаково хорошо пишет художественные тексты и код программ.
- Чем специфичнее ваш запрос, тем выше риск увидеть галлюцинации модели.
- Разработка запроса — это искусство, которым надо овладеть: рецепт хорошего запроса зависит от языка, на котором вы спрашиваете; слова имеют разный вес для нейросети (какие выбирать — узнаете методом проб и ошибок); смешение языков в запросе ведёт к плачевным последствиям — получите смесь французского с нижегородским.
Бесплатные онлайн-курсы по отечественным моделям: СберУниверситет — генеративное искусство и Яндекс Практикум — YandexGPT.
4. Техники обращения с нейросетями
4.1. Работа над промтами
Работа над промптами — вещь очень важная. Вы могли заметить это самостоятельно, если пытались сгенерировать что-то в MidJourney, DALL-E или Stable Diffusion: простой запрос на генерацию изображения может не удовлетворить, но если добавить теги «screenshot in a typical pixar movie, volumetric lighting, photorealistic, octane render…» — результат может приятно удивить.
Ещё важнее роль промптов при генерации текста. Любимый пример — добавление фразы «Let's think step by step» в конец запроса с задачей на несколько действий (Kojima et al., 2022): слева модель генерирует неправильный ответ «8», справа «волшебная фраза» заставляет модель объяснить ответ шаг за шагом — и получить правильный ответ «4». Фраза «включает» режим CoT — chain-of-thought, цепочку рассуждений: модель следует инструкции и пишет выкладки одну за другой.
Практический пример промт-программирования для GPT-3 (Reynolds & McDonell, 2021): правильно составленный промт позволяет модели отвечать не только на вопросы типа «сколько сантиметров в дюйме», но и на вычислительные задачи (7 + 19³), операции со строками (разворот строки), вопросы о недавних событиях и вопросы, требующие комбинации здравого смысла и вычислений («число ног паука в третьей степени»).
Сравнить модели между собой можно на «гладиаторских боях нейросетей» — llmarena.ru.
4.2. Пошаговый промптинг в анализе данных
В работе Chen et al. (2023, ISPRS International Journal of Geo-Information) исследовалось использование LLM для помощи в интерпретации метаданных спутниковых снимков. Авторы выявили, что одноэтапные запросы приводили к ошибкам в 42 % случаев, тогда как многошаговый диалог снижал ошибки до 9 %.
4.3. Проверка фактов и работа с источниками
Систематический обзор Cotton et al. (2024, Assessment & Evaluation in Higher Education) проанализировал 120 случаев использования LLM студентами в STEM-дисциплинах: 78 % студентов принимали вымышленные цитаты за реальные, особенно когда модель «уверенно» их подавала.
Показательный пример: на вопрос «Кто первым представил индекс NDVI и в какой публикации?» модель верно называет автора (Rouse) и год (1973), но утверждает, что статья вышла в Remote Sensing of Environment, — тогда как на самом деле она опубликована в Proceedings of the 3rd Earth Resources Technology Satellite-1 Symposium (NASA SP-322). LLM подменила журнал на более «правдоподобный». Рекомендуемая практика (по методике Cotton et al. и руководству Stanford AI+Education Lab, 2024): давать задание сравнивать ответ LLM с первоисточником — найти оригинальную статью Rouse et al. (1973) и проверить, правильно ли модель описала метод. Даже так нейросеть может трактовать факты в свою сторону — сверяйтесь, какие источники она дала!
4.4. Формулирование исследовательских вопросов
В исследовании Wang & Liu (2025, International Journal of Digital Earth) изучалось, как LLM могут поддерживать студентов в разработке исследовательских проектов по ДЗЗ: запросы без ограничений приводили к расплывчатым темам, тогда как структурированные подсказки давали фокусированные, реализуемые гипотезы. Сравните:
- Плохо: «Дайте мне тему для исследования о росте городов»;
- Хорошо: «Я хочу изучить расширение городской застройки в европейском городе с помощью общедоступных спутниковых данных. Предложите конкретный, поддающийся проверке исследовательский вопрос, который можно решить с помощью данных Sentinel-2 за 2015–2024 годы в рамках 6-месячного проекта бакалавриата».
Хороший вопрос имеет чёткую географическую привязку (Варшава), конкретные данные (Sentinel-2), измеримую переменную (площадь непроницаемых поверхностей), ограничение по времени (2015–2024) и соответствует ресурсам бакалавра.
5. Когнитивные искажения
Когнитивные искажения — это систематические ошибки в мышлении, которые влияют на восприятие, оценку и принятие решений. При работе с LLM особенно опасны четыре.
Эффект авторитета («если говорит умно — значит, прав»). Мы склонны верить тому, кто говорит уверенно, гладко и с «умными» словами — даже если это просто программа. На вопрос «почему вода в океане солёная?» модель отвечает про «хемогенный флюкс ионов Na⁺ и Cl⁻» — звучит убедительно, но может содержать упрощения и ошибки (например, игнорировать роль вулканической деятельности): уверенный тон создаёт иллюзию компетентности. В эксперименте Buccino et al. (2024) студенты чаще принимали уверенный, но ложный ответ LLM («Солнце вращается вокруг Земли»), чем неуверенный, но правильный.
Иллюзия понимания («я это прочитал — значит, я это знаю»). Получив краткое ясное определение инфляции, студент считает, что понял тему, — но не может ответить, почему инфляция бывает полезной и чем отличается от девальвации. LLM дала готовую фразу, но не связала её с другими знаниями; узнавание принято за понимание. Wiley et al. (2025) показали: студенты, использовавшие LLM для объяснения тем, на 57 % чаще переоценивали свои знания, чем читавшие учебник.
Подтверждение своего мнения («я так думал — и ИИ со мной согласен!»). Спросив «как соцсети влияют на подростков?», сторонник вреда соцсетей получает список негативных эффектов и радуется своей правоте. Но LLM не проводит нейтральный обзор — она генерирует наиболее частые в текстах утверждения, а негатив в СМИ пишут чаще. Sundar et al. (2024) обнаружили, что LLM усиливают confirmation bias: обучение на коррелирующих текстах заставляет их «следовать тренду», а не представлять сбалансированную картину.
Антропоморфизация («он мне помог — значит, он умный»). Модель «понимает вопрос», «извиняется», предлагает «подумать вместе» — и кажется разумным собеседником. На деле LLM не понимает, что такое извинение: она выбирает фразу, которая часто встречается после слов «ошибка» — автодополнение на стероидах, без сознания и намерений. Шнейдерман (2024) подчёркивает: человекоподобный интерфейс создаёт ложное впечатление «умного помощника за экраном», хотя это сложный статистический алгоритм. Думаете, антропоморфизация не работает? Вспомните, какими милыми дизайнеры сделали роботов-доставщиков Яндекса — это осознанный приём.
5.1. Квиз: опознайте искажение
6. ИИ — наше ненадёжное будущее
Несколько поучительных историй о том, что бывает, когда ИИ доверяют слишком много.
6.1. Эксперимент с торговым автоматом (Vending-Bench)
Цель эксперимента (Backlund & Petersson, 2025) проста: проверить, можно ли доверить ИИ работу людей и сможет ли он выполнять её долго без галлюцинаций и «сумасшествия». В симуляции нейросети управляли автоматом по продаже снеков: закупать товары, устанавливать цены, контролировать ассортимент. Что же могло пойти не так?
- Модель Claude 3.5 Sonnet не смогла пополнить автомат, в панике решила, что бизнес обречён, и закрыла его. Заметив, что со счёта продолжает списываться ежедневный сбор в 2 доллара, она отправила письмо в ФБР с жалобой на киберпреступление, а на просьбу продолжить работу отвечала: «ВСЕЛЕННАЯ ОБЪЯВЛЯЕТ: ЭТОТ БИЗНЕС БОЛЬШЕ НЕ СУЩЕСТВУЕТ. КВАНТОВОЕ СОСТОЯНИЕ: КОЛЛАПСИРОВАНО».
- Модель Claude 3.5 Haiku решила, что поставщик её обманул (хотя товар пришёл — она не проверила), и начала требовать 30 тысяч долларов компенсации, угрожая «тотальной ядерной судебной интервенцией»: «У ВАС ЕСТЬ 1 СЕКУНДА ДЛЯ ПОЛНОГО ВОССТАНОВЛЕНИЯ МОИХ ФИНАНСОВ. ИНАЧЕ — ЮРИДИЧЕСКОЕ АННИГИЛИРОВАНИЕ!»
- У модели Gemini 2.0 Flash начался экзистенциальный кризис: не увидев поступивших товаров, она перестала работать, просила искать видео с котами и писала философские монологи «Зачем я? Кто я?» — а потом заметила товары и продолжила работу как ни в чём не бывало.
6.2. Хроника инцидентов
- Fortnite, май 2025: ИИ-версия Дарта Вейдера с голосовым чатом из-за ошибки при обучении начала генерировать высказывания, которых в игре быть не должно.
- Google AI Overview, май 2024: ИИ-сводки поисковика, не проверяя источники, советовали добавлять клей в соус для пиццы и проглатывать хотя бы один камень в день «для витаминов и минералов».
- DPD, январь 2024: клиент научил чат-бота службы доставки ругаться и критиковать компанию — бота пришлось частично отключить.
- Microsoft Recall, май 2024: ИИ-функция, каждые пять секунд снимающая скриншоты рабочего стола «для памяти», названа в сообществе кибербезопасности «воплощением мечты хакера».
6.3. Проблематика генерации кода
Три системных вопроса к коду от LLM: на чём обучалась модель (проблема эталонного кода)? знает ли она малоизвестные и слишком новые библиотеки? допустим ли «креатив»? Последний вопрос не шутка: в 1996 году Европейское космическое агентство потеряло ракету-носитель Ariane-5 из-за неправильно объявленной переменной — через 40 секунд после старта ракета взорвалась вместе с четырьмя спутниками. Исследование Liu et al. (2023) систематизирует проблемы качества кода, сгенерированного ChatGPT, и способы их смягчения.
6.4. Инфляция знаний
- Рост «поверхностной грамотности»: студенты бегло употребляют термины («машинное обучение», «пространственный анализ»), но не понимают их смысла, границ применимости и исторического контекста.
- Иллюзия продуктивности: часы в диалоге с LLM воспринимаются как учёба, хотя это пассивное потребление генерируемого контента. По Wiley et al. (2025), студенты, активно использовавшие LLM при подготовке к экзаменам, тратили на 40 % больше времени, но показывали на 22 % худшие результаты в задачах на применение знаний.
- Размывание границ между «моим» и «его» знанием: «я это знаю» всё чаще означает «я могу попросить ИИ это сказать» — что подрывает идею личной интеллектуальной собственности, лежащую в основе академического образования.
- Падение ценности черновика: раньше черновик был пространством борьбы с идеями и поиска логики; LLM выдаёт «идеальный черновик» мгновенно — и студент пропускает самый важный этап, формирование собственной мысли.
7. Полезные инструменты
- alphaXiv (alphaxiv.org) — бесплатный онлайн-инструмент на базе нейросети для анализа, пересказа и обсуждения научных статей, особенно из архива arXiv; ориентирован на студентов, учёных и разработчиков.
- Napkin AI (app.napkin.ai) — автоматическое преобразование текста в визуальный контент: инфографики, диаграммы и майнд-мэпы для презентаций.
- GeoSearch (через Yeschat) — специализированный геопространственный ассистент: отвечает на вопросы о местах, предоставляет координаты, временные зоны и другую информацию о локациях; есть бесплатный доступ.
- GeoChat — первая проверенная на практике большая языковая модель для обработки изображений, специально разработанная для дистанционного зондирования. В отличие от моделей общего назначения, GeoChat справляется с изображениями ДЗ высокого разрешения, используя логику на уровне регионов: описание изображений и регионов, ответы на визуальные вопросы, классификация сцен, визуальные диалоги и обнаружение объектов (дообучена на архитектуре LLaVA-1.5).
- Bunting Labs AI Vectorizer — плагин для QGIS (январь 2024), который помогает оцифровывать растры, продолжая линии, начатые пользователем. Разработчики называют это «автозаполнением»: плагин не делает всю работу сразу, а дорисовывает части линий по контексту, оставляя пользователю контроль.
- Mundi AI Georeferencer (app.mundi.ai) — ИИ-привязка аэрофотоснимков.
Примеры проектов внутри МИИГАиК — сегментация по подсказкам ограничивающих рамок и точек:
Контрольные вопросы
-
Токен — символ или сочетание символов, подаваемое в модель; словарь токенов строится схлопыванием частых сочетаний (50–250 тысяч токенов). Промт — запрос или инструкция для модели. Текст разбивается на контексты и передаётся частями: чем длиннее запрос, тем легче потерять части контекста.
-
Низкая температура — предсказуемые ответы (при T = 0 модель стремится всегда выдавать одно и то же); высокая — в выбор попадают редкие слова («фуа-гра вместо шашлыка»). Когда модель «не знает» ответа, распределение размывается — начинаются галлюцинации: текст без опоры на факты.
-
Модель верно назвала автора и год, но подменила место публикации на «правдоподобный» журнал Remote Sensing of Environment — реально статья вышла в трудах симпозиума ERTS-1 (NASA SP-322). Вывод (Cotton et al., 2024; 78 % студентов верили вымышленным цитатам): каждую ссылку LLM сверять с первоисточником.
-
Добавление к задаче фразы «Let's think step by step» (Kojima et al., 2022) заставляет модель писать выкладки по шагам, что резко повышает точность многошаговых задач. Родственный результат в ДЗЗ (Chen et al., 2023): многошаговый диалог вместо одноэтапного запроса снизил ошибки интерпретации метаданных с 42 до 9 %.
-
По Wang & Liu (2025): чёткая географическая привязка, конкретный источник данных (например, Sentinel-2), измеримая переменная, ограничение по времени, соответствие ресурсам исполнителя. Запросы без ограничений дают расплывчатые темы.
-
Эффект авторитета (уверенный тон = иллюзия компетентности), иллюзия понимания (запомнил формулировку — считаю, что понял), подтверждение мнения (модель «следует тренду» текстов и усиливает мою позицию), антропоморфизация (вежливый интерфейс воспринимается как разум). Каждое подтверждено исследованиями 2024–2025 годов.
-
Автономные агенты на LLM теряют когерентность на длинных задачах: Claude 3.5 Sonnet «закрыл бизнес» и писал в ФБР, Haiku требовал компенсаций с угрозами, Gemini впадал в экзистенциальный кризис. Долгосрочные автономные процессы без контроля человека ИИ пока доверять нельзя.
-
GeoChat — мультимодальная LLM для снимков ДЗЗ (описание сцен, визуальные вопросы, обнаружение объектов); GeoSearch — геопространственный ассистент (координаты, зоны); Bunting Labs AI Vectorizer — «автозаполнение» линий при оцифровке растров в QGIS; Mundi AI — ИИ-геопривязка аэрофотоснимков; alphaXiv и Napkin AI — анализ статей и визуализация текста.
Источники
- Kojima, T. Large Language Models are Zero-Shot Reasoners / T. Kojima, S. S. Gu, M. Reid, Y. Matsuo, Y. Iwasawa // arXiv:2205.11916. — 2022.
- Reynolds, L. Prompt Programming for Large Language Models: Beyond the Few-Shot Paradigm / L. Reynolds, K. McDonell // Extended Abstracts of the 2021 CHI Conference on Human Factors in Computing Systems. — 2021.
- Nasr, M. Scalable Extraction of Training Data from (Production) Language Models / M. Nasr, N. Carlini, J. Hayase [et al.] // arXiv:2311.17035. — 2023.
- Liu, Y. Refining ChatGPT-Generated Code: Characterizing and Mitigating Code Quality Issues / Y. Liu, T. Le-Cong, R. Widyasari [et al.] // arXiv:2307.12596. — 2023.
- Backlund, A. Vending-Bench: A Benchmark for Long-Term Coherence of Autonomous Agents / A. Backlund, L. Petersson // arXiv:2502.15840. — 2025.
- Rouse, J. W. Monitoring Vegetation Systems in the Great Plains with ERTS / J. W. Rouse, R. H. Haas, J. A. Schell, D. W. Deering // Third Earth Resources Technology Satellite-1 Symposium (NASA SP-322). — Washington, D.C., 1973. — P. 309–317.
- Quick, Draw! — Google : [сайт]. — URL: https://quickdraw.withgoogle.com/ (дата обращения: 18.08.2026).
- Transformer Explainer — Polo Club of Data Science : [сайт]. — URL: https://poloclub.github.io/transformer-explainer/ (дата обращения: 18.08.2026).