Anthropic сократила биологические ограничения Fable 5 на 85%
Fable 5 теперь сможет работать с более широким кругом биологических задач. Пользователи должны заметить меньше переключений на другую модель при обращениях, связанных с повседневным здоровьем и образованием: например, при разборе результатов анализов, изучении симптомов и биологии в учебном контексте. Медицинские специалисты также получат больше поддержки Fable 5 в клинической работе.
Anthropic считает, что наибольший потенциал для положительного влияния ИИ связан с биологией и медициной. Компания инвестирует в способы ответственного доступа биологов к передовым возможностям моделей. Сейчас Fable по-прежнему перенаправляет в Opus 5 запросы, которые относятся к биологии двойного назначения, включая вирусологию, токсикологию и молекулярный дизайн. Поэтому модель пока нельзя полноценно использовать для профессиональных биологических исследований и разработки лекарств. Anthropic намерена сократить этот разрыв с помощью проверенных каналов доступа к передовым биологическим возможностям.
Риск биологических задач
Компания хочет как можно быстрее предоставить передовые возможности Fable 5 большему числу пользователей, но одновременно ей нужно учитывать риски моделей такого уровня. В некоторых сложных биологических задачах Fable 5 уже превосходит экспертов, а в других может оказывать практическую поддержку. Это помогает исследователю разрабатывать новое лечение, но те же способности могут попасть к злоумышленнику и использоваться, например, для создания биологического оружия.
Оценки возможностей Anthropic показывают, что Fable 5 способен существенно усилить потенциал такого злоумышленника — то есть дать ему способности, которых у него не было бы из других доступных источников.
Полезное и вредоносное применение ИИ в биологии часто трудно разделить. Для разработки лечения иногда приходится получать опасные соединения, вызывающие то же заболевание. Особенно наглядный пример — живые вакцины: чтобы создать их, учёным нужно выращивать патоген, против которого вакцина предназначена. Похожая ситуация встречается и в фармакологии. При разработке каптоприла — препарата от гипертонии — исследователи выделили токсичные компоненты змеиного яда, резко снижающие давление у человека.
По мере развития биологических возможностей передовых моделей Anthropic хочет не допустить, чтобы связанные с ними риски проявились раньше научной пользы.
Опытные злоумышленники могут использовать неоднозначность таких задач, скрывая намерения и выдавая опасную работу за обычное исследование. В ежегодной оценке угроз разведывательного сообщества США за 2026 год говорится, что такие акторы существуют, а развитие биотехнологий, включая синтетическую биологию и редактирование генома, «может привести к появлению новых биологических угроз».
В документе также отмечается, что несколько государств, вероятно, продолжают действующие наступательные программы в области биологического и химического оружия. Доступ к базовым возможностям передовых моделей ИИ может ускорить такие программы.
Почему Fable 5 часто переключалась на Opus 5
Из-за опасений вокруг возможностей двойного назначения Anthropic запустила Fable 5 с блокировкой почти всех биологических запросов. Это позволило открыть модель для пользователей в других областях, но привело к большому числу ложных срабатываний: даже безопасные биологические вопросы блокировались и передавались менее способной модели.
Компания пошла на такой компромисс, поскольку возможное злоупотребление Fable в биологии двойного назначения могло иметь катастрофические последствия.
Один из основных механизмов защиты — классификаторы безопасности. Это небольшие автоматизированные системы ИИ, которые определяют, просит ли пользователь Fable 5 выполнить защищаемую биологическую задачу или создать вредоносный результат. Anthropic уже описывала похожие классификаторы для кибербезопасности.
Когда классификатор срабатывает, Fable 5 перенаправляет запрос пользователя в Opus 5. Эта модель тоже обладает широкими возможностями, но уступает Fable 5 в биологии и поэтому не может предоставить злоумышленнику такой же уровень помощи. Именно это переключение пользователи видят после блокировки запроса.
Создать точный и устойчивый классификатор непросто. Он должен быстро и последовательно отличать разрешённые темы и запросы от тех, которые компания считает потенциально опасными. Настройка требует времени: нужно уменьшать число ложных срабатываний, когда блокируется безопасный контент, и ложных пропусков, когда опасный запрос остаётся незамеченным.
Кроме того, классификаторы должны противостоять попыткам обхода защиты. Для этого нужны дополнительные исследования и тестирование.
Изначально Anthropic использовала очень широкий биологический классификатор. Это позволило открыть пользователям доступ к Fable 5 и продолжить работу над его уточнением. Ожидание дальнейшего развития защитных механизмов отложило бы общий доступ к модели на недели или месяцы.
Как обновили классификатор
За последние несколько недель Anthropic переписала «конституцию» классификатора — набор правил, по которым он различает защищаемый и разрешённый контент. В новой версии подробно описали безопасные сценарии использования.
Компания собрала отзывы от разных специалистов внутри Anthropic и за её пределами. Затем на основе обновлённых правил подготовили новые обучающие данные, заново обучили классификатор и проверили его работу.
Новая версия по-прежнему должна срабатывать на вредоносных и биологических исследованиях двойного назначения, но при этом разрешать больше безопасных и полезных запросов.
По сравнению с моментом запуска Fable 5 классификатор теперь блокирует гораздо меньше безопасных обращений, связанных с биологией.
Иллюстрация наших биологических классификаторов. Контент, попадающий на левую сторону границы классификатора, разрешён; контент, попадающий на правую сторону, защищён (и поэтому блокируется и вместо этого отправляется менее способной модели); явно вредоносный контент (красный) и контент двойного назначения (оранжевый) активируют классификатор и блокируются. Мы включаем запас безопасности, который
Источник: anthropic.com
Anthropic отмечает, что работу над защитой ещё предстоит продолжить. Ложные срабатывания всё равно останутся: часть запросов попадает в запас безопасности классификатора, когда риск очень низок, но система всё ещё блокирует обращение.
Профессиональные запросы по биологии двойного назначения и разработке лекарств Fable пока продолжит блокировать из-за потенциального риска. Компания намерена создать безопасный и масштабируемый путь для исследователей, которым нужен доступ к наиболее способным моделям, через проверенные каналы.
По данным Anthropic, обновление сократило число переключений на другие модели для биологических и любых иных запросов примерно на 67% в Claude.ai, на 55% в Cowork, на 17% в Claude Code и на 7% в Claude Platform.
Другие объявления Anthropic
Компания открывает исследовательскую предварительную версию «Стандарта оборудования для моделей» (MHS) — общей спецификации, которая должна позволить ИИ-агентам безопасно управлять физическими устройствами. На первом этапе доступ получит группа научных лабораторий и передовых производителей.
С сегодняшнего дня 10 000 учёных по всему миру смогут начать пользоваться Claude бесплатно. Подтверждённые руководители исследований получат право на тариф Claude Team, после чего смогут бесплатно добавить свою исследовательскую команду на обычные места. Места с расширенными возможностями будут стоить $15 в месяц, сроком до одного года.
Также Anthropic запускает грантовую программу на $5 млн для независимых исследований влияния ИИ на благополучие пользователей.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram