K2

K² · Искусственный интеллект

Тесты, по которым судят о прогрессе ИИ-программистов, шатаются от смены железа

В статье проводится аудит трёх бенчмарков оптимизации производительности на уровне репозиториев (GSO, SWE-Perf и SWE-fficiency), которые оценивают агентов по написанию кода путём применения патчей к реальным репозиториям и сравнения времени выполнения с неоптимизированными базовыми версиями и эталонными патчами.

ZC
ZS

Zhi Chen, Zhensu Sun, Yuling Shi и др.

5 авторов · cs.SE, cs.AI

Препринт arXivИскусственный интеллектиюль 2026 г. · ~60 с чтения

Суть за 30 секунд

Возьмите один и тот же тест кода, запустите его на четырёх разных серверах Google Cloud — и половина «эталонных» ответов провалится.

  1. Авторы утверждают, что рейтинги лидерборда могут смешивать нестабильность времени выполнения, специфичные для бенчмарка правила подсчёта баллов и количество задач, уже решённых хотя бы одной публичной отправкой.
  2. Исследование повторило официальные эталонные патчи для 740 задач оптимизации кода на четырёх распространённых типах машин Google Cloud.
  3. Большинство задач бенчмарка можно повторить, но эталонные патчи удовлетворяют исходные правила валидности бенчмарка при всех перекрёстных повторах на разных машинах только для 39 из 102 задач GSO, 11 из 140 задач SWE-Perf и 411 из 498 задач SWE-fficiency.
740 code optimization tasks replayed across four types of Google Cloud machinesReference patches passed every cross-machine replay for only 39/102 GSO tasksReference patches passed every cross-machine replay for only 11/140 SWE-Perf tasks