K2

K² · Искусственный интеллект

«Ты слишком рано повернул»: ИИ учат на ошибках через слова, а не оценки

Авторы предлагают фреймворк языковой критики для обучения имитацией на неоптимальных демонстрациях, который использует естественный язык как сигнал структурированного обучения вместо скалярных сигналов.

CY
DW

Chih-Han Yang, Dai-Jie Wu, Yun-Ping Huang и др.

6 авторов · cs.LG, cs.AI

Препринт arXivИскусственный интеллектиюль 2026 г. · ~65 с чтения

Суть за 30 секунд

Представь, что учишь ребёнка кататься на велосипеде.

  1. Метод конструирует языковые метки из демонстраций, описывающие текущий прогресс, выявляющие неоптимальное поведение и обеспечивающие детальное корректирующее руководство.
  2. Авторы вводят функцию потерь с языковой критикой, которая обучает политики с использованием этих структурированных сигналов без их редукции к скалярам.
  3. Функция потерь реализуется как для клонирования поведения, так и для политик диффузии, что приводит к двум методам под названием LC-BC и LC-DP.