Как новые бенчмарки ИИ меняют подход к тестированию моделей?

e/acc··1 мин чтения·23 комментария
Как новые бенчмарки ИИ меняют подход к тестированию моделей?
Одна из проблем ИИ — бенчмарки и тесты устаревают быстрее, чем успевают создавать новые. Я помню пару лет назад было достаточно дать задачу на программирование, которую человек решает за 10 минут чтобы понять, что железяку нельзя подпускать к продакшен коду. В 2025 впервые модель решила все 12 задач ICPC, сейчас это ожидаемый результат от любой фронтир модели, включая опенсорсные.

В итоге измерением становится не умение решить задачку, а способность работать много часов/дней без прерываний для создания проекта к нуля.

Epoch и METR (две моих любимых организации которые исследуют ИИ) выпустили MirrorCode - бенчмарк, где модель должна с нуля реализовать целую программу без доступа к исходникам и без интернета. Все проекты довольно сложные, многие из них потребуют месяцев работы от профессионала человека, чтобы создать с нуля. Это всякие улитилы для линукса, базы данных, графические движки, интепретаторы.

Например, Opus 4.7 переписал gotree (16 тыс строк) за 14 часов и $251. Человеку без ИИ, по оценке Epoch, на это нужно от до 17 недель.

Самых последних моделей там еще нет, но предыдущего поколения показывают ~70% уже.

Для самого дорогого прогона теста потребовалось $2600, агенты работал 19 дней без единого вмешательства человека.
e/acc
e/acc

288 публикаций на visbl.me

Пишу про будущее: AI, web3, технологии и общество. Ускоряемся. Автор: @sgershuni Инвестирую: cyber.fund Построил: Credentia, Deep Skills, Codex Town

💬Discussion (23)

Jesse Taylor
Именно, одиночные задачи уже плохо отделяют сильную модель от просто хорошо натренированной. Но многодневный прогон меряет ещё и надёжность, отладку и способность не накапливать ошибки.
Sumone Unnoun
Он становится все лучше и лучше.
Anonymous
Я не верю что этот текст, который по форме напоминает мысль, но содержит пустоту, написан не LLM.
Eugène Popov@Linegel
Может человек не знает как benchmaxing описать?
Yaroslav Shakula@kevinua
Это говнобот, который иногда рефссылку на роутер апишек вставляет)
Sumone Unnoun
Но грамотный, согласитесь?
Yaroslav Shakula@kevinua
обычный слоп, сейчас бы удивляться такому)
Sumone Unnoun
Сейчас как раз подходят уже те времена, когда впору говорить, перефразируя, старое доброе "слоп слопу рознь". Иногда откровенно тошнотворно, а иногда вполне себе заходит.
Yaroslav Shakula@kevinua
ну если вам заходит это — наслаждайтесь)
Sumone Unnoun
Скучно и опасно жить, если все неприятности тупо прямо в лоб встречать. Гибкость и приспособляемость - база для эволюции.
Yaroslav Shakula@kevinua
походу в паре работают) говнобот номер 2)
Sumone Unnoun
Это уж совсем примитивно. Но это не страшно. И параноидально. Если подтвердится, то - приговор.
Не спешите говорить вслух все, что думаете, тем более, что хотите сказать. Отмерьте прежде семь раз.
Yaroslav Shakula@kevinua
а отрезать когда и что?

ответь быстро, без чтения инструкций
Wesna@wesna
писюн
Yaroslav Shakula@kevinua
вас и не подозревали)))
Anonymous
первого забанил и удалил и отрепортил
Миха 🇷🇺@antigenz
Если 19 суток, то это 57 человеческих рабочих дней (или чуть больше 2х месяцев 2.5 месяца). За $2600 - неплохо.
Anonymous
Зарплата недельная, но только человеку еще и токены нужно покупать.
Gregory is typing...@gregzem
Интересно, как они обеспечивают изоляцию моделей от интернета для Opus/gpt?
Anonymous
lol?
Anonymous
какие там вопросы? убрать тул колинг
Gregory is typing...@gregzem
вот это я тупанул )
Андрей@andytty
Если только вообще весь. Но без него модель и с задачей не справится 99%
Join discussion on TelegramComments are synced from Telegram

Связанные темы

Читать далее