«Безопасного ИИ нет в природе»: Почему нейросети сливают данные и причем тут промпт-хакеры

«Безопасного ИИ нет в природе»: Почему нейросети сливают данные и причем тут промпт-хакеры
0

В этом материале разбираемся, почему нейросети периодически выходят за рамки допустимого — от выдачи персональных данных до опасных ответов. 

Мы поговорили с экспертом по маркетингу и визуализации данных Павлом Лебедевым и попросили его объяснить, как на самом деле формируются знания у ИИ, почему фильтры не всегда срабатывают и можно ли вообще говорить о «безопасном ИИ» сегодня. 

Первый факт, что ни одна из ИИ компаний не делает безопасный ИИ по данным AI Safety Index

«Безопасного ИИ нет в природе»: Почему нейросети сливают данные и причем тут промпт-хакеры

Для того чтобы понять, почему такие ситуации происходят, нужно разобраться, как работают нейросети и откуда у них берется знание. Знание формируется на основе обучающей выборки — того, что было скормлено модели во время обучения. Например, ChatGPT обучался на огромном количестве постов с Reddit, открытых данных Википедии, публичных сайтов и других источников. И если модель неожиданно выдает персональные данные, можно предположить, что она обучалась и на них — возможно, такие данные попали в тренировочную выборку.

Машина работает как предсказательная функция: она фактически предугадывает, какое слово наиболее вероятно будет следующим в предложении. Например, если вы напишете: «В лесу родилась…» — логичным продолжением будет «елочка». Другой вариант вряд ли придет в голову, потому что это — устойчивый шаблон.

Если в обучающих данных оказались контакты человека, и вы впишете его имя, модель может выдать эти контакты. В этом нет ничего удивительного. Главное — правильно сформулировать запрос, чтобы продолжение соответствовало тому, что заложено в базе данных. Если промт (запрос) составлен неправильно, то обычный пользователь может не получить нужного результата.

Но это, конечно, не отменяет риски. И вот следующий момент — наличие фильтров, которые накладываются на любую языковую модель. Они проверяют, насколько действия модели соответствуют этическим и правовым нормам.

Если говорить об умных и продвинутых моделях вроде ChatGPT, Claude, Gemini, то у них стоит механизм предфильтрации. То есть модель как бы сама читает свой ответ и оценивает, допустимо ли это выдавать. Иногда видно, как она начинает писать, затем замолкает — потому что поняла, что начала говорить что-то недопустимое. У Claude, например, бывают случаи, когда он распознает запрос как потенциально опасный и отказывается отвечать.

Фильтры задаются по-разному. Например, Grok изначально позиционировался как модель без фильтров, которая дает максимально честные ответы. А что значит честные? Ну, спросили у нее персональные данные — она и выдала. Откуда они? Как туда попали? Это уже, получается, десятый вопрос.

Поэтому здесь нужно учитывать несколько моментов:

Опасность нейросетей. Сами по себе они не несут угрозы, но угрозу представляют способы их использования. Уже появилась профессия промт-хакеров, которые умеют с помощью специальных запросов получать из модели информацию, которую обычный пользователь не увидит.

Слив персональных данных. Часто сами пользователи где-то оставляют свои данные, которые затем могут попасть в открытые или полуоткрытые базы — а оттуда в обучающие датасеты. Не сливайте свои данные, но в современном мире это почти невозможно: базы передаются, продаются, перекочевывают от одной маркетинговой компании к другой. Поэтому этот риск пока остается.

Так что подобные ситуации будут происходить и дальше. Просто будьте внимательны: следите, где и какие данные вы вводите. А лучше — не вводите лишнего. И, конечно, осторожнее относитесь к нейросетям.

Комментарии: 0
Как вам статья?
/ 5
Комментарии (0)
Читатели еще не оставили комментарий, будьте первым!

— для отправки комментария вам необходимо
Забыли пароль?

Введите ваше имя пользователя или адрес email. Вы получите email сообщение с инструкциями по сбросу пароля.

Создание аккаунта

X