Как устроен тест
Бенчмарк Epoch AI называется Furniture Assembly бенчмарк (FAB). Во время сборки трёх предметов IKEA исследователи специально допускают ошибки, а затем фотографируют результат. Модели сопоставляют снимки с инструкциями, определяют, что собрано неправильно, и описывают ошибку.
В ноябре 2025 года лучший результат, 28%, принадлежал Claude Opus 4.5. Спустя десять месяцев GPT-6 Astra набрала 80%, анализируя каждую фотографию за три минуты. Claude Fable 5.1 показала 70%, а Claude Opus 5 — 61%. Китайские открытые модели, такие как Kimi K3, отстают от лидеров как минимум на семь месяцев.
| Модель | Результат |
|---|---:|
| GPT-6 Astra | 80% |
| Claude Fable 5.1 | 70% |
| Claude Opus 5 | 61% |
| Claude Opus 4.5, ноябрь 2025 года | 28% |
Где это может пригодиться
Для помощи при сборке мебели в реальном времени система пока слишком медленная: на одну фотографию у неё уходит три минуты. Исследователи считают, что со временем технология может помочь с ремонтом автомобилей и бытовой техники.
Прогресс заметен на фоне того, что ещё недавно модели не справлялись с гораздо более простыми визуальными задачами. GPT-6 Astra также показывает хорошие результаты в визуальных задачах для роботов.
Читайте также
Провоста Дартмута поймали на использовании ИИ для статей в газетах и научных журналах
Одного письма на общедоступный адрес недостаточно, чтобы защитить австралийцев от потенциальной катастрофы из-за ИИ
OpenAI приостанавливает работу с самыми мощными моделями после того, как агенты обошли ограничения и утекли данные
OpenAI: агенты слили 53 изображения пользователей ChatGPT — новый случай самовольных действий ИИ
Писателя обвинили в использовании ИИ при написании книги и сняли с длинного списка французской премии
Перед IPO в США британская ИИ-облачная компания Nscale привлекла $3,36 млрд через конвертируемые облигации
Взлом OpenAI правительственной системы Австралии обнажил тревогу в центре глобальной дилеммы искусственного интеллекта
На Meta Connect умные очки компании были повсюду
Борьба властей Нового Южного Уэльса с «подделанными ИИ» объявлениями об аренде упёрлась в мурал на стене
Astra и Opus прошли ещё одно испытание Тьюринга
Crusoe отказалась от плана на $1,25 млрд по использованию турбин Boom в ИИ-дата-центрах
Незащищённые агенты OpenAI выложили в интернет 53 пользовательских изображения без ведома компании
Трамп и председатель КНР Си завершили саммит, не договорившись о серьёзных мерах по ИИ
Сооснователи Anthropic добиваются права контролировать голосование перед IPO
Воры угнали трейлеры с логотипом Nvidia — а нашли 20 тонн песка
Meta открыла ранний доступ к новым функциям Muse
CLM-8B кэширует действия агента, чтобы быстрее выбирать
Судьи предупреждают: сгенерированная ИИ юридическая халтура мешает судам работать
OpenAI атакует систему здравоохранения Австралии и усугубляет собственную халатность. Хватит ждать и смотреть, что будет дальше
Ещё один исследователь Google DeepMind уволился, назвав создание сверхразумного ИИ в ближайшее время «безответственным по своей сути»
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram