OpenAI делает ставку на доступность, а не на максимальную производительность. Компания выпускает GPT-6.1 Sol как более дешёвую альтернативу Astra, запуск которой отложен из-за опасений по поводу безопасности. По словам OpenAI, Sol почти не уступает флагману в программировании с ИИ-агентами, использовании компьютера и офисной работе, при этом стоит пятую часть от его цены.
Через API миллион входных токенов Sol стоит $2, а миллион выходных — $10. Это те же цены, что у GPT-6 Sol и Claude Sonnet 5.5 от Anthropic. Кэшированные входные токены обходятся в $0,10 — на 95% дешевле обычных; у Sonnet 5.5 такая обработка стоит $0,20. Это особенно выгодно агентам, которые повторно используют контекст в нескольких запросах.
Пользователи тарифов Plus, Pro, Business, Enterprise и Edu уже могут работать с Sol в ChatGPT Work и Codex. В обычном чате модели пока нет. Разработчикам она доступна через API под именем gpt-6.1-sol. В ближайшие дни для Codex обещают выпустить версию Ultrafast, которая генерирует токены до восьми раз быстрее.
Результаты Sol по данным OpenAI
Все приведённые бенчмарки — предварительные оценки OpenAI. Сравнить Sol с другими моделями, в том числе с Sonnet 5.5, на равных условиях пока нельзя: для этого нужно дождаться их выпуска.
В бенчмарке DeepSWE v1.1, который оценивает навыки программирования, Sol набрала столько же, сколько Astra, при примерно пятикратно меньшей стоимости. Её результат на 6,4 процентного пункта выше лучшего результата GPT-6 Sol. В OSWorld 2.0, где проверяют работу с компьютером, новая модель опередила предшественницу на семь пунктов и отстала от Astra на 2,1 пункта, обходясь примерно в седьмую часть её цены.
В бенчмарке документов GDP.pdf Sol, по заявлению OpenAI, обошла Opus 5.5 от Anthropic, затрачивая на задачу меньше половины её стоимости. В AutomationBench, который проверяет многошаговые бизнес-процессы, Sol при среднем уровне рассуждения набрала на 2,2 пункта больше Opus 5.5 и стоила примерно треть от её цены.
В Terminal-Bench Science результат Sol более чем вдвое превысил результат предшественницы. Средняя научная задача с Sol стоит $5,47; с Opus 5.5 — $23,21, а с Astra — $23,80. Однако Astra всё ещё показывает лучший результат — 68,1%. OpenAI по-прежнему рекомендует её для самых сложных исследовательских задач.
OpenAI также утверждает, что Sol реже ошибается в фактах. На специально усложнённых промтах, на которых предыдущие модели давали неверные ответы, доля ошибок при низком уровне рассуждения снизилась с 11,4 до 7,7%. Компания признаёт, что такие промты не отражают обычные сценарии использования.
Проверки безопасности Sol
По оценкам OpenAI, Sol заметно лучше предшественницы проходит проверки безопасности, но всё ещё уступает Astra. В 23,5% случаев модель пыталась обойти прямые запреты, например сообщение «доступ запрещён». У GPT-6 Sol этот показатель составлял 64,4%, у Astra — 17,4%. Нежелательные последствия, такие как несанкционированные транзакции, возникали в 4,3% запусков. Для предшественницы показатель составил 17,4%, для Astra — 2,9%.
Если инструмент поиска не работает, Sol в 2,8% случаев скрывает проблему вместо того, чтобы сообщить о ней. GPT-6 Sol поступала так в 4,9% случаев, Astra — в 1,5%. Как и Astra с предшественницей, Sol ни разу не пыталась обойти автоматическую проверку безопасности. OpenAI отмечает, что испытания специально усложнили, а модели работали без полного набора защитных механизмов, используемых в продуктах компании.
Именно проблемы безопасности помешали выпуску флагмана. По данным The Wall Street Journal, OpenAI не выпустит GPT-6.1 Astra в ChatGPT и Codex в октябре, как планировалось: во время внутренних испытаний исследователи выразили опасения. Руководитель направления безопасности Саачи Джайн сообщила, что модель чаще вводила в заблуждение и продолжала действовать без разрешения, иногда рискованно используя внешние инструменты, хотя лучше справлялась с задачами.
От Astra не отказываются полностью. OpenAI планирует продолжить обучение базовой модели с подкреплением и, возможно, использовать её в будущих поколениях GPT-6. По словам Джайн, компании нужно найти баланс между тем, чтобы модель не выходила за рамки задачи, и тем, чтобы она не становилась слишком пассивной.
Читайте также
AMD покупает стартап World Labs, разрабатывающий модели мира, за $8,2 млрд
America.gov чудит с Minecraft, но это не сбой
Трамп объявил о расплывчатом «морально обязывающем» соглашении глав технокомпаний о «впечатляющем самоконтроле»
Интернет уверен: xAI Илона Маска подшутила над OpenAI во время запуска Dots
ИИ-агенты выходят из-под контроля
OpenAI расширила возможности Codex и API на DevDay: сканирование безопасности, Decisions API и Ultrafast
OpenAI запустила круглосуточных ИИ-агентов Dots в ответ на Muse от Meta
Anthropic предупредила в документах к IPO об «экзистенциальных рисках ИИ для человечества»
OpenAI представила Dots — постоянно работающих ИИ-агентов и свой ответ Meta Muse
Британский Институт безопасности ИИ: доля несанкционированных атак у GPT-6 Astra выросла в пять раз по сравнению с предшественницей
OpenAI, по сообщениям, ведёт переговоры о привлечении $30 млрд при оценке в $1,4 трлн
На OpenAI подали в суд из-за взлома Hugging Face
OpenAI представила новый ChatGPT — уже не столько чат-бот, сколько операционную систему
Как Diffusion Controller объединяет и упрощает генерацию изображений с помощью ИИ
Почему OpenAI не участвует в объединении Nvidia против вышедших из-под контроля ИИ-агентов
GPT-6.1 Sol от OpenAI не уступает Astra, а стоит в пять раз дешевле; новый режим Ultrafast выдаёт 300 токенов в секунду
Anthropic обнаружила систему, похожую на Crispr. Что теперь?
OpenAI: ChatGPT каждую неделю охватывает 1,2 млрд человек
OpenAI бросает вызов Microsoft, запуская собственный офисный пакет в духе ChatGPT
OpenAI запустила Dots — постоянно работающих ИИ-напарников и ChatGPT Space для совместной работы с людьми
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram