K2

K² · Искусственный интеллект

Проверка ответов ИИ по шагам — аудируемая замена непрозрачным LLM-оценкам

Авторы представляют Theoria — архитектуру верификации, которая переписывает предложенное решение в последовательность типизированных переходов состояния, каждый из которых обоснован явным образом через цитату, вычисление или факт из условия задачи.

BS
MS

Ben Slivinski, Michael Saldivar

2 автора · cs.AI, cs.CL, cs.LG, cs.LO, cs.SE

Препринт arXivИскусственный интеллектиюль 2026 г. · ~55 с чтения

Суть за 30 секунд

Когда можно доверять ответу ИИ?

  1. Фундаментальный принцип Theoria — полнота изменений: каждое различие между последовательными шагами доказательства должно быть объяснено, чтобы скрытые предположения выявлялись как необоснованные скачки.
  2. На наборе HLE-Verified Gold (185 текстовых задач от экспертов) Theoria подтверждает корректность 105 задач с точностью 91,4% по строгому критерию (доверительный интервал Вилсона 95% [84,5%, 95,4%]).
  3. Каждое подтверждение корректности порождает читаемый человеком след доказательства, в котором каждый шаг можно независимо проверить.
HLE-Verified Gold consists of 185 text-only expert problemsTheoria certifies 105 of the HLE-Verified Gold problems at 91.4% strict precision (Wilson 95% CI [84.5%, 95.4%])Holistic LLM judges fail on different problems (Jaccard 0.14-0.36)