Как новые бенчмарки ИИ меняют подход к тестированию моделей?

e/acc··1 мин чтения·31 комментарий
Как новые бенчмарки ИИ меняют подход к тестированию моделей?
Одна из проблем ИИ — бенчмарки и тесты устаревают быстрее, чем успевают создавать новые. Я помню пару лет назад было достаточно дать задачу на программирование, которую человек решает за 10 минут чтобы понять, что железяку нельзя подпускать к продакшен коду. В 2025 впервые модель решила все 12 задач ICPC, сейчас это ожидаемый результат от любой фронтир модели, включая опенсорсные.

В итоге измерением становится не умение решить задачку, а способность работать много часов/дней без прерываний для создания проекта к нуля.

Epoch и METR (две моих любимых организации которые исследуют ИИ) выпустили MirrorCode - бенчмарк, где модель должна с нуля реализовать целую программу без доступа к исходникам и без интернета. Все проекты довольно сложные, многие из них потребуют месяцев работы от профессионала человека, чтобы создать с нуля. Это всякие улитилы для линукса, базы данных, графические движки, интепретаторы.

Например, Opus 4.7 переписал gotree (16 тыс строк) за 14 часов и $251. Человеку без ИИ, по оценке Epoch, на это нужно от до 17 недель.

Самых последних моделей там еще нет, но предыдущего поколения показывают ~70% уже.

Для самого дорогого прогона теста потребовалось $2600, агенты работал 19 дней без единого вмешательства человека.
e/acc
e/acc

311 публикаций на visbl.me

Пишу про будущее: AI, web3, технологии и общество. Ускоряемся. Автор: @sgershuni Инвестирую: cyber.fund Построил: Credentia, Deep Skills, Codex Town

💬Discussion (31)

Jesse Taylor
Именно, одиночные задачи уже плохо отделяют сильную модель от просто хорошо натренированной. Но многодневный прогон меряет ещё и надёжность, отладку и способность не накапливать ошибки.
Sumone Unnoun
Он становится все лучше и лучше.
Anonymous
Я не верю что этот текст, который по форме напоминает мысль, но содержит пустоту, написан не LLM.
Eugène Popov@Linegel
Может человек не знает как benchmaxing описать?
Yaroslav Shakula@kevinua
Это говнобот, который иногда рефссылку на роутер апишек вставляет)
Sumone Unnoun
Но грамотный, согласитесь?
Yaroslav Shakula@kevinua
обычный слоп, сейчас бы удивляться такому)
Sumone Unnoun
Сейчас как раз подходят уже те времена, когда впору говорить, перефразируя, старое доброе "слоп слопу рознь". Иногда откровенно тошнотворно, а иногда вполне себе заходит.
Yaroslav Shakula@kevinua
ну если вам заходит это — наслаждайтесь)
Sumone Unnoun
Скучно и опасно жить, если все неприятности тупо прямо в лоб встречать. Гибкость и приспособляемость - база для эволюции.
Yaroslav Shakula@kevinua
походу в паре работают) говнобот номер 2)
Sumone Unnoun
Это уж совсем примитивно. Но это не страшно. И параноидально. Если подтвердится, то - приговор.
Не спешите говорить вслух все, что думаете, тем более, что хотите сказать. Отмерьте прежде семь раз.
Yaroslav Shakula@kevinua
а отрезать когда и что?

ответь быстро, без чтения инструкций
Wesna@wesna
писюн
Yaroslav Shakula@kevinua
вас и не подозревали)))
Anonymous
первого забанил и удалил и отрепортил
Миха 🇷🇺@antigenz
Если 19 суток, то это 57 человеческих рабочих дней (или чуть больше 2х месяцев 2.5 месяца). За $2600 - неплохо.
Anonymous
Зарплата недельная, но только человеку еще и токены нужно покупать.
Gregory is typing...@gregzem
Интересно, как они обеспечивают изоляцию моделей от интернета для Opus/gpt?
Anonymous
lol?
Anonymous
какие там вопросы? убрать тул колинг
Gregory is typing...@gregzem
вот это я тупанул )
Андрей@andytty
Если только вообще весь. Но без него модель и с задачей не справится 99%
Андрей Камалов@AGI_Medicine
Не понятно, а как обеспечивается непрерывность работы? Это какой-то Loop или система какая-то?
Андрей Камалов@AGI_Medicine
Тут люди пилят проекты, с 5 подписками максимальными минимум уже полгода. Это они пользоваться эффективно не умеют или как?
Anonymous
Они же не понимают что они хотят
Join discussion on TelegramComments are synced from Telegram

Связанные темы

Читать далее