K² · Искусственный интеллект
Модель, обучаясь у самой себя, теряет разнообразие решений
В работе исследуется самодистилляция on-policy, где одна модель одновременно выступает учителем и учеником — учитель получает условие в виде правильного примера и выдаёт обратную связь на уровне каждого токена.
AN
MP
Andrei Liviu Nicolicioiu, Mohammad Pezeshki, Aaron Courville
3 автора · cs.LG, cs.AI
Суть за 30 секунд
Представьте студента, который сам себе учитель.
- Авторы показывают, что высокая точность pass@1 при самодистилляции скрывает проблему: разнообразие генерируемых последовательностей падает, кривые pass@k становятся плоскими, и создание большего числа попыток больше не улучшает результаты.
- Они объясняют потерю разнообразия накопленными смещениями в способе работы самодистилляции — когда учитель оценивает выходы через собственные предубеждения модели.
- Авторы теоретически анализируют оптимальную политику самодистилляции и показывают, что она переweight базовое распределение по метрике условной взаимной информации между выходом ученика и правильным выходом, используемым как контекст.