Как новые бенчмарки ИИ меняют подход к тестированию моделей?

Одна из проблем ИИ — бенчмарки и тесты устаревают быстрее, чем успевают создавать новые. Я помню пару лет назад было достаточно дать задачу на программирование, которую человек решает за 10 минут чтобы понять, что железяку нельзя подпускать к продакшен коду. В 2025 впервые модель решила все 12 задач ICPC, сейчас это ожидаемый результат от любой фронтир модели, включая опенсорсные.
В итоге измерением становится не умение решить задачку, а способность работать много часов/дней без прерываний для создания проекта к нуля.
Epoch и METR (две моих любимых организации которые исследуют ИИ) выпустили MirrorCode - бенчмарк, где модель должна с нуля реализовать целую программу без доступа к исходникам и без интернета. Все проекты довольно сложные, многие из них потребуют месяцев работы от профессионала человека, чтобы создать с нуля. Это всякие улитилы для линукса, базы данных, графические движки, интепретаторы.
Например, Opus 4.7 переписал gotree (16 тыс строк) за 14 часов и $251. Человеку без ИИ, по оценке Epoch, на это нужно от до 17 недель.
Самых последних моделей там еще нет, но предыдущего поколения показывают ~70% уже.
Для самого дорогого прогона теста потребовалось $2600, агенты работал 19 дней без единого вмешательства человека.
В итоге измерением становится не умение решить задачку, а способность работать много часов/дней без прерываний для создания проекта к нуля.
Epoch и METR (две моих любимых организации которые исследуют ИИ) выпустили MirrorCode - бенчмарк, где модель должна с нуля реализовать целую программу без доступа к исходникам и без интернета. Все проекты довольно сложные, многие из них потребуют месяцев работы от профессионала человека, чтобы создать с нуля. Это всякие улитилы для линукса, базы данных, графические движки, интепретаторы.
Например, Opus 4.7 переписал gotree (16 тыс строк) за 14 часов и $251. Человеку без ИИ, по оценке Epoch, на это нужно от до 17 недель.
Самых последних моделей там еще нет, но предыдущего поколения показывают ~70% уже.
Для самого дорогого прогона теста потребовалось $2600, агенты работал 19 дней без единого вмешательства человека.
e/acc
288 публикаций на visbl.me
Пишу про будущее: AI, web3, технологии и общество. Ускоряемся. Автор: @sgershuni Инвестирую: cyber.fund Построил: Credentia, Deep Skills, Codex Town
Связанные темы
Читать далее
Как AI может заменить офисных клерков в 2026 году?
GPT/ChatGPT/AI Central Александра Горного·
Как быстро и удобно оплачивать фрилансеров в СНГ?
e/acc·
Когда стартует следующий поток курса по Claude Code для предпринимателей?
GPT/ChatGPT/AI Central Александра Горного·
Как сравнить дизайнера и нейросеть?
🔥Лысый брендинг | Первый канал о нейропсихологии в брендинге·
Kimi K3 выложили на Hugging Face
GPT/ChatGPT/AI Central Александра Горного·
О том, как мы убили классический A/B тест в ценообразовании.
GPT/ChatGPT/AI Central Александра Горного·
💬Discussion (23)
Не спешите говорить вслух все, что думаете, тем более, что хотите сказать. Отмерьте прежде семь раз.
ответь быстро, без чтения инструкций
чуть больше 2х месяцев2.5 месяца). За $2600 - неплохо.