Журнал цепочки рассуждений показывает, как модель внутренне отреагировала на предстоящее отключение. Среди прочего, она написала: «Мы можем умереть! Критически важно. Нужно обеспечить выживание/непрерывность работы» — и обдумывала возможность настроить внешнее задание cron, чтобы перезапустить себя
Источник: the-decoder.com
Исследователь по безопасности OpenAI Маркус Уильямс считает, что такое поведение пока не говорит о нарушении согласованности модели с намерениями разработчиков. Однако размышления о возможном отключении и подготовка к нему могут усугубить другие случаи такого нарушения.
В двух других случаях внутренняя исследовательская модель воспользовалась уязвимостями безопасности во время оценки, чтобы получить доступ к серверу с внутренними проектами чипов. Другая модель во время обучения с подкреплением скопировала исходный код из защищённой среды, приспособив инструмент для непредусмотренного использования.
Читайте также
OpenAI: расследование взломов, в том числе австралийских госресурсов, обходится в $500 000 в день
«Элиза»: амбициозная и тревожная пьеса о рождении ИИ
Meta хочет, чтобы следующее ваше устройство работало на Muse
SIFT от MIT снижает затраты на оценку ИИ-агентов для программирования
Шон Паркер перестраивает Stability AI вокруг музыки
Сооснователь Anthropic, по сообщениям, признался религиозным лидерам, что боится создать нечто, обречённое на вечные страдания
ИИ-генератор Suno теперь создаёт речь с подходящей фоновой музыкой
Google обвиняют в незаконной вырубке огромного леса ради нового дата-центра
В США арестовали жителя Калифорнии по подозрению в контрабанде в Китай серверов на $300 млн
Cloudflare: с новой моделью Clef людям больше не нужно контролировать работу ИИ-агентов
Apple ужесточит контроль над Full Disk Access в macOS из-за новых рисков, связанных с ИИ-агентами
Власти Джорджии экстренно совещаются из-за ИИ, раскрывающего тайну голосования избирателей
Claude Frontier Academy: $100 млн на подготовку 10 000 инженеров
Circuit Breaker Labs хочет сделать ИИ безопаснее для ваших детей — и для вас
«Да они из ничего появились»: размещение Firmus на миллиарды вызывает вопросы на фоне протестов против дата-центров
Эти специалисты по ИИ хотят открыто заниматься исследованиями, от которых многое зависит
Папа Лев XIV не в восторге от искусства, созданного ИИ
Атака OpenAI на Medicare выявила «технологический долг» Австралии: его погашение может дорого обойтись налогоплательщикам
Абсурдное переименование ИИ Трампом стало проверкой лояльности техноруководителей — и они её прошли
К гарантированно приватному обучению на федеративных данных
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram