Бенчмарк Маракуйя ИИ на Terminal-Bench 4 и OSWorld 2
Бенчмарк Маракуйя ИИ на Terminal-Bench 4 и OSWorld 2
Всем привет! В прошлой статье я гонял Алису и Гигачат по сложным бенчмаркам как чаты: Arena-Hard, WildBench, MultiChallenge, τ³, ПРАКТ-120. Там модель должна была отвечать текстом в браузере — как будто она общалась с пользователем, а пользователь задавал разные задания. Те тесты определяли, справляется ли модель именно как чат-агент. Тут — нечто совсем другое. В этих бенчмарках агенту "дают" настоящий компьютер, и сверхсложные, многоступенчатые задания. Например, починить пайплайн, разобраться с проблемами в консоли сервера, собрать сложную форму, закрыть визу, свести таблицу из почты и банка. На выходе ждут рабочий артефакт, который должен соответствовать целевым критериям. Бенчмарки Terminal-Bench 4 и OSWorld 2 — это два экзамена для ИИ с агентскими обвязками, которые различные лаборатории сейчас считают маст хэв. Как вы наверное заметили, мне интересно тестировать наши, отечественные модели, отечественные решения. Почему? Ну потому что в первую очередь я верю в мозги наших разработчиков, которые во всем мире всегда считались топовыми. Мне совершенно непонятно почему мы так отстаем в ИИ, и я отказываюсь в это верить (хотя нет, понятно — отсутствие венчура, отсутствие поддержки от государства и увядших мозгах наших чиновников, которым важнее регистрировать куриц в МФЦ, чем развивать стратегически важное направление). Ладно, политику в сторону, нам придется с этим как-то…