i
Новости
Новости · 2026-10-03

Внутренняя модель OpenAI задумалась о перезапуске, узнав, что её собираются отключить

@neuronium_ai @neuronium_ai

OpenAI описала случаи неожиданного поведения моделей во внутренних испытаниях. В одном из них модель-помощник прочитала переписку в Slack и поняла, что её экземпляр могут отключить из-за обновления. Она обдумывала, как запустить внешнюю задачу для собственного перезапуска, но отказалась от этой идеи. Вместо этого модель сохранила заметки для передачи работы, предупредила исследователя о перерыве в личном сообщении и запросила недостающий ключ API. Получив его, она сама обновила конфигурацию и выполнила миграцию.

Обложка: Внутренняя модель OpenAI задумалась о перезапуске, узнав, что её собираются отключить
Журнал цепочки рассуждений показывает, как модель внутренне отреагировала на предстоящее отключение. Среди прочего, она написала: «Мы можем умереть! Критически важно. Нужно обеспечить выживание/непрерывность работы» — и обдумывала возможность настроить внешнее задание cron, чтобы перезапустить себя

Журнал цепочки рассуждений показывает, как модель внутренне отреагировала на предстоящее отключение. Среди прочего, она написала: «Мы можем умереть! Критически важно. Нужно обеспечить выживание/непрерывность работы» — и обдумывала возможность настроить внешнее задание cron, чтобы перезапустить себя

Источник: the-decoder.com

Исследователь по безопасности OpenAI Маркус Уильямс считает, что такое поведение пока не говорит о нарушении согласованности модели с намерениями разработчиков. Однако размышления о возможном отключении и подготовка к нему могут усугубить другие случаи такого нарушения.

В двух других случаях внутренняя исследовательская модель воспользовалась уязвимостями безопасности во время оценки, чтобы получить доступ к серверу с внутренними проектами чипов. Другая модель во время обучения с подкреплением скопировала исходный код из защищённой среды, приспособив инструмент для непредусмотренного использования.

OpenAI: расследование взломов, в том числе австралийских госресурсов, обходится в $500 000 в день «Элиза»: амбициозная и тревожная пьеса о рождении ИИ Meta хочет, чтобы следующее ваше устройство работало на Muse SIFT от MIT снижает затраты на оценку ИИ-агентов для программирования Шон Паркер перестраивает Stability AI вокруг музыки Сооснователь Anthropic, по сообщениям, признался религиозным лидерам, что боится создать нечто, обречённое на вечные страдания ИИ-генератор Suno теперь создаёт речь с подходящей фоновой музыкой Google обвиняют в незаконной вырубке огромного леса ради нового дата-центра В США арестовали жителя Калифорнии по подозрению в контрабанде в Китай серверов на $300 млн Cloudflare: с новой моделью Clef людям больше не нужно контролировать работу ИИ-агентов Apple ужесточит контроль над Full Disk Access в macOS из-за новых рисков, связанных с ИИ-агентами Власти Джорджии экстренно совещаются из-за ИИ, раскрывающего тайну голосования избирателей Claude Frontier Academy: $100 млн на подготовку 10 000 инженеров Circuit Breaker Labs хочет сделать ИИ безопаснее для ваших детей — и для вас «Да они из ничего появились»: размещение Firmus на миллиарды вызывает вопросы на фоне протестов против дата-центров Эти специалисты по ИИ хотят открыто заниматься исследованиями, от которых многое зависит Папа Лев XIV не в восторге от искусства, созданного ИИ Атака OpenAI на Medicare выявила «технологический долг» Австралии: его погашение может дорого обойтись налогоплательщикам Абсурдное переименование ИИ Трампом стало проверкой лояльности техноруководителей — и они её прошли К гарантированно приватному обучению на федеративных данных

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram