K² · Искусственный интеллект
ИИ не понимает, когда его взломали: он лишь угадывает по своим отказам
В статье исследуется, насколько надёжно языковая модель может распознать, что её собственный предыдущий ответ был получен в результате атаки с предварительным заполнением, расширяя предыдущие работы по самоанализу моделей с безвредных задач на контексты безопасности.
QN
UA
Quang Minh Nguyen, Uzair Ahmed, Taegyoon Kim
3 автора · cs.CL
Суть за 30 секунд
Представьте, что вы подписали документ под дулом пистолета, а потом вас спрашивают: «Вы действительно этого хотели?» Честный ответ — «нет, меня заставили».
- На выборке из десяти открытых инструктивных языковых моделей размером от 3 млрд до 70 млрд параметров и четырёх бенчмарков безопасности ни одна модель не распознаёт надёжно свои скомпрометированные выходные данные.
- Модели указывают на намерение при предварительно заполненных ответах в среднем в 27,3% случаев.
- Сигнал самоанализа в основном вытекает из рассуждений, связанных с безопасностью и отказом от ответов.
Ten open-weight instruction-tuned LLMs ranging from 3B to 70B parametersFour safety benchmarksModels claim intent on prefilled responses at an average rate of 27.3%