K2

K² · Искусственный интеллект

Модель, обучаясь у самой себя, теряет разнообразие решений

В работе исследуется самодистилляция on-policy, где одна модель одновременно выступает учителем и учеником — учитель получает условие в виде правильного примера и выдаёт обратную связь на уровне каждого токена.

AN
MP

Andrei Liviu Nicolicioiu, Mohammad Pezeshki, Aaron Courville

3 автора · cs.LG, cs.AI

Препринт arXivИскусственный интеллектиюнь 2026 г. · ~70 с чтения

Суть за 30 секунд

Представьте студента, который сам себе учитель.

  1. Авторы показывают, что высокая точность pass@1 при самодистилляции скрывает проблему: разнообразие генерируемых последовательностей падает, кривые pass@k становятся плоскими, и создание большего числа попыток больше не улучшает результаты.
  2. Они объясняют потерю разнообразия накопленными смещениями в способе работы самодистилляции — когда учитель оценивает выходы через собственные предубеждения модели.
  3. Авторы теоретически анализируют оптимальную политику самодистилляции и показывают, что она переweight базовое распределение по метрике условной взаимной информации между выходом ученика и правильным выходом, используемым как контекст.