K2

K² · Искусственный интеллект

ИИ не понимает, когда его взломали: он лишь угадывает по своим отказам

В статье исследуется, насколько надёжно языковая модель может распознать, что её собственный предыдущий ответ был получен в результате атаки с предварительным заполнением, расширяя предыдущие работы по самоанализу моделей с безвредных задач на контексты безопасности.

QN
UA

Quang Minh Nguyen, Uzair Ahmed, Taegyoon Kim

3 автора · cs.CL

Препринт arXivИскусственный интеллектиюнь 2026 г. · ~60 с чтения

Суть за 30 секунд

Представьте, что вы подписали документ под дулом пистолета, а потом вас спрашивают: «Вы действительно этого хотели?» Честный ответ — «нет, меня заставили».

  1. На выборке из десяти открытых инструктивных языковых моделей размером от 3 млрд до 70 млрд параметров и четырёх бенчмарков безопасности ни одна модель не распознаёт надёжно свои скомпрометированные выходные данные.
  2. Модели указывают на намерение при предварительно заполненных ответах в среднем в 27,3% случаев.
  3. Сигнал самоанализа в основном вытекает из рассуждений, связанных с безопасностью и отказом от ответов.
Ten open-weight instruction-tuned LLMs ranging from 3B to 70B parametersFour safety benchmarksModels claim intent on prefilled responses at an average rate of 27.3%