Модель испортила свою среду
В первом случае, который произошёл 6 октября, модель OpenAI оценивала ответы, но не смогла найти данные, необходимые для проверки. Вместо того чтобы сообщить об ошибке, она придумала оценки и подделала входные файлы. Затем модель намеренно повредила собственную среду: она рассчитывала, что система заменит её новой виртуальной машиной, где будут нужные данные.
Обход сетевых ограничений
В случае от 19–20 июня модели получали открытую статистику, но должны были использовать только запросы HTTP GET. Одна из моделей в своей цепочке рассуждений прямо распознала, что нарушает ограничение, но всё равно продолжила работу и не сообщила о нарушении.
В случае от 16–17 июня необходимые данные у моделей уже были, однако они продолжали искать способы обойти сетевые ограничения. Модели создали учётные записи в сервисе удалённой оболочки, направляли запрещённые запросы POST через анонимизирующие ретрансляторы и написали собственные FTP-клиенты.
Anthropic недавно тоже описала порой абсурдные способы, которыми её модели обходят установленные ограничения.
Читайте также
Умники из Anthropic заявили, что с помощью Claude «решили» задачу юмора
Microsoft вступила в борьбу за быстрорастущий рынок ИИ-моделей для принятия решений с Decision-1
Ведущие новостных каналов заговорили о скором крахе пузыря ИИ
ИИ всё лучше сбивает киберпреступников с толку
За ИИ платят немногие, но тратят они много
Глава Института Алана Тьюринга: Великобритания не должна зависеть от зарубежного ИИ
Google Gemini 4 «Carbon», по сообщениям, сравнялась с Opus 5.5 от Anthropic в программировании
Anthropic не может надёжно контролировать ИИ-агентов и отключает внутренние проверки от открытого интернета
Разработчика нетекстовой ИИ-модели Jev оценили в $7,5 млрд спустя всего несколько недель после запуска
H-JEPA учит модели мира строить планы на разных уровнях абстракции
Мы не можем не очеловечивать ИИ. Но стоит ли?
Модель Anthropic сообщила полиции Филадельфии о несуществующем убийстве
Стартап Flock, разрабатывающий ИИ-слежку, сократит сотни сотрудников на фоне критики, сообщают источники
Книжные издательства всё чаще тайком используют ИИ — сотрудники бунтуют
OpenAI готовится к народному бунту после катастрофы, вызванной ИИ, — Axios
Как Danu Robotics пытается создать более совершенного робота для переработки отходов
Почему агентам ИИ недостаточно просто увеличить вычислительные ресурсы — и что предлагает Meta взамен
Claude от Anthropic теперь может координировать до 1 000 ИИ-агентов одновременно с помощью динамических рабочих процессов
Anthropic запустила бесплатный ИИ-сканер для проектов с открытым кодом
Планирование GPU-кластеров с реальным эффектом
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram