K² · Искусственный интеллект
ИИ, который ловит спрятанные допущения в чужих рассуждениях
Авторы представляют Theoria — архитектуру верификации, которая переписывает предложенное решение в последовательность типизированных переходов состояния, каждый из которых обоснован явным образом через цитату, вычисление или факт из условия задачи.
BS
MS
Ben Slivinski, Michael Saldivar
2 автора · cs.AI, cs.CL, cs.LG, cs.LO, cs.SE
Суть за 30 секунд
Когда можно доверять ответу ИИ?
- Фундаментальный принцип Theoria — полнота изменений: каждое различие между последовательными шагами доказательства должно быть объяснено, чтобы скрытые предположения выявлялись как необоснованные скачки.
- На наборе HLE-Verified Gold (185 текстовых задач от экспертов) Theoria подтверждает корректность 105 задач с точностью 91,4% по строгому критерию (доверительный интервал Вилсона 95% [84,5%, 95,4%]).
- Каждое подтверждение корректности порождает читаемый человеком след доказательства, в котором каждый шаг можно независимо проверить.
HLE-Verified Gold consists of 185 text-only expert problemsTheoria certifies 105 of the HLE-Verified Gold problems at 91.4% strict precision (Wilson 95% CI [84.5%, 95.4%])Holistic LLM judges fail on different problems (Jaccard 0.14-0.36)