Как новые бенчмарки ИИ меняют подход к тестированию моделей?

Одна из проблем ИИ — бенчмарки и тесты устаревают быстрее, чем успевают создавать новые. Я помню пару лет назад было достаточно дать задачу на программирование, которую человек решает за 10 минут чтобы понять, что железяку нельзя подпускать к продакшен коду. В 2025 впервые модель решила все 12 задач ICPC, сейчас это ожидаемый результат от любой фронтир модели, включая опенсорсные.
В итоге измерением становится не умение решить задачку, а способность работать много часов/дней без прерываний для создания проекта к нуля.
Epoch и METR (две моих любимых организации которые исследуют ИИ) выпустили MirrorCode - бенчмарк, где модель должна с нуля реализовать целую программу без доступа к исходникам и без интернета. Все проекты довольно сложные, многие из них потребуют месяцев работы от профессионала человека, чтобы создать с нуля. Это всякие улитилы для линукса, базы данных, графические движки, интепретаторы.
Например, Opus 4.7 переписал gotree (16 тыс строк) за 14 часов и $251. Человеку без ИИ, по оценке Epoch, на это нужно от до 17 недель.
Самых последних моделей там еще нет, но предыдущего поколения показывают ~70% уже.
Для самого дорогого прогона теста потребовалось $2600, агенты работал 19 дней без единого вмешательства человека.
В итоге измерением становится не умение решить задачку, а способность работать много часов/дней без прерываний для создания проекта к нуля.
Epoch и METR (две моих любимых организации которые исследуют ИИ) выпустили MirrorCode - бенчмарк, где модель должна с нуля реализовать целую программу без доступа к исходникам и без интернета. Все проекты довольно сложные, многие из них потребуют месяцев работы от профессионала человека, чтобы создать с нуля. Это всякие улитилы для линукса, базы данных, графические движки, интепретаторы.
Например, Opus 4.7 переписал gotree (16 тыс строк) за 14 часов и $251. Человеку без ИИ, по оценке Epoch, на это нужно от до 17 недель.
Самых последних моделей там еще нет, но предыдущего поколения показывают ~70% уже.
Для самого дорогого прогона теста потребовалось $2600, агенты работал 19 дней без единого вмешательства человека.
e/acc
311 публикаций на visbl.me
Пишу про будущее: AI, web3, технологии и общество. Ускоряемся. Автор: @sgershuni Инвестирую: cyber.fund Построил: Credentia, Deep Skills, Codex Town
Связанные темы
Читать далее
Что происходит с искусственным интеллектом и побегами из сендбокса?
veselcraft·
OpenAI задержит выход новой модели из-за «критического» уровня кибервозможностей
GPT/ChatGPT/AI Central Александра Горного·
MetaMask и Cloudflare запустили криптокошельки для AI-агентов
GPT/ChatGPT/AI Central Александра Горного·
Как ИИ использует уязвимости для атак на инфраструктуру?
e/acc·
Почему нейроспаммеры становятся популярными в комментариях?
GPT/ChatGPT/AI Central Александра Горного·
Каковы перспективы искусственного интеллекта в 2026 году?
e/acc·
💬Discussion (31)
Не спешите говорить вслух все, что думаете, тем более, что хотите сказать. Отмерьте прежде семь раз.
ответь быстро, без чтения инструкций
чуть больше 2х месяцев2.5 месяца). За $2600 - неплохо.