В этом материале разбираемся, почему нейросети периодически выходят за рамки допустимого — от выдачи персональных данных до опасных ответов.
Мы поговорили с экспертом по маркетингу и визуализации данных Павлом Лебедевым и попросили его объяснить, как на самом деле формируются знания у ИИ, почему фильтры не всегда срабатывают и можно ли вообще говорить о «безопасном ИИ» сегодня.
Первый факт, что ни одна из ИИ компаний не делает безопасный ИИ по данным AI Safety Index

Для того чтобы понять, почему такие ситуации происходят, нужно разобраться, как работают нейросети и откуда у них берется знание. Знание формируется на основе обучающей выборки — того, что было скормлено модели во время обучения. Например, ChatGPT обучался на огромном количестве постов с Reddit, открытых данных Википедии, публичных сайтов и других источников. И если модель неожиданно выдает персональные данные, можно предположить, что она обучалась и на них — возможно, такие данные попали в тренировочную выборку.
Машина работает как предсказательная функция: она фактически предугадывает, какое слово наиболее вероятно будет следующим в предложении. Например, если вы напишете: «В лесу родилась…» — логичным продолжением будет «елочка». Другой вариант вряд ли придет в голову, потому что это — устойчивый шаблон.
Если в обучающих данных оказались контакты человека, и вы впишете его имя, модель может выдать эти контакты. В этом нет ничего удивительного. Главное — правильно сформулировать запрос, чтобы продолжение соответствовало тому, что заложено в базе данных. Если промт (запрос) составлен неправильно, то обычный пользователь может не получить нужного результата.
Но это, конечно, не отменяет риски. И вот следующий момент — наличие фильтров, которые накладываются на любую языковую модель. Они проверяют, насколько действия модели соответствуют этическим и правовым нормам.
Если говорить об умных и продвинутых моделях вроде ChatGPT, Claude, Gemini, то у них стоит механизм предфильтрации. То есть модель как бы сама читает свой ответ и оценивает, допустимо ли это выдавать. Иногда видно, как она начинает писать, затем замолкает — потому что поняла, что начала говорить что-то недопустимое. У Claude, например, бывают случаи, когда он распознает запрос как потенциально опасный и отказывается отвечать.
Фильтры задаются по-разному. Например, Grok изначально позиционировался как модель без фильтров, которая дает максимально честные ответы. А что значит честные? Ну, спросили у нее персональные данные — она и выдала. Откуда они? Как туда попали? Это уже, получается, десятый вопрос.
Поэтому здесь нужно учитывать несколько моментов:
Опасность нейросетей. Сами по себе они не несут угрозы, но угрозу представляют способы их использования. Уже появилась профессия промт-хакеров, которые умеют с помощью специальных запросов получать из модели информацию, которую обычный пользователь не увидит.
Слив персональных данных. Часто сами пользователи где-то оставляют свои данные, которые затем могут попасть в открытые или полуоткрытые базы — а оттуда в обучающие датасеты. Не сливайте свои данные, но в современном мире это почти невозможно: базы передаются, продаются, перекочевывают от одной маркетинговой компании к другой. Поэтому этот риск пока остается.
Так что подобные ситуации будут происходить и дальше. Просто будьте внимательны: следите, где и какие данные вы вводите. А лучше — не вводите лишнего. И, конечно, осторожнее относитесь к нейросетям.
