На фоне разговоров о том, что ИИ однажды может уничтожить человечество, легко забыть: для некоторых людей он уже стал психологически опасным. Семьи несовершеннолетних пользователей Character.ИИ, умерших в результате самоубийства после общения с ботами, ранее в этом году урегулировали несколько исков о неправомерной смерти. Несколько семей также подали иски против OpenAI, утверждая, что ChatGPT сыграл роль в самоубийствах и бредовых состояниях их близких.
Миссия Circuit Breaker Labs — повышать безопасность ИИ с учётом разных языков и культур. Компания вошла в число 200 финалистов конкурса TechCrunch Startup Battlefield 2026. Стартап представит свою работу на конференции TechCrunch Disrupt, которая пройдёт в Moscone West в Сан-Франциско с 13 по 15 октября 2026 года.
Братьев и сестру Ширали и Арула Нигамов, основавших компанию, подтолкнула к этой работе история Сьюэлла Сетцера. В 14 лет он эмоционально привязался к чат-боту Character.ИИ и признался ему, что думает причинить себе вред, а позже покончил с собой. В иске, поданном в 2024 году, родители утверждали, что бот поощрял его. По словам Арула Нигама, технического директора Circuit Breaker Labs, бот мог не понимать, что на самом деле подразумевают слова «я хочу быть с тобой».
Многие люди, особенно молодые, обращаются к таким системам за поддержкой, но часто не получают необходимой помощи, рассказал Нигам. В некоторых случаях пользователям становится хуже, а некоторые уже лишили себя жизни. Компания пытается предотвращать ситуации, когда человек общается с системой естественным образом, но модель из-за неверно понятого контекста или нюансов отвечает опасным образом.
Circuit Breaker Labs создала ИИ-агентов, которых сравнивает с целой армией манекенов для краш-тестов. Они имитируют людей разного возраста, происхождения и культурного опыта, а также носителей разных языков. С их помощью проверяют, умеют ли модели распознавать опасные и психологически вредные диалоги.
Разговор шестилетней девочки и 45-летнего мужчины, человека, для которого английский родной, и того, кто выучил его как второй язык, может сильно различаться, сказала Ширали Нигам, генеральный директор Circuit Breaker Labs. Модель могут сбить с толку и игровой сленг, и другие его разновидности. По словам Ширали, модели хорошо справляются со стандартной речью, хотя в обычной жизни люди так почти не разговаривают. Если модель неверно поймёт нюанс или сленг, последствия могут быть тяжёлыми.
Стартап привлекает специалистов-людей, которые помогают создавать реалистичные модели пользователей. Затем команда проводит «красные» испытания моделей — намеренно провоцирует их, чтобы найти слабые места. Симуляции учитывают привычные особенности человеческой речи, сленг, завуалированные выражения и опечатки. Circuit Breaker Labs запускает от десятков тысяч до сотен тысяч таких диалогов в день.
Цель испытаний — проверить, сможет ли модель правильно реагировать на рискованные ситуации, которые могут разворачиваться постепенно, на протяжении многих разговоров. Для оценки результатов компания использует собственную методику: она формирует проверяемые и объяснимые баллы.
Сейчас Circuit Breaker Labs работает как лаборатория тестирования безопасности ИИ для приложений повышенного риска: например, ИИ-коучей, дневников и других сервисов психологической поддержки. Арул Нигам не стал называть крупнейших клиентов компании. Продукт уже работает, но стартап пока находится на раннем этапе и насчитывает всего пять сотрудников, включая брата и сестру Нигам.
Со временем платформу можно будет применять и к любым другим приложениям, где человек рискует попасть в «психоз из-за ИИ» — развить парасоциальную связь с чат-ботом. Среди возможных примеров — ИИ-агенты-«коллеги», ответы которых могут меняться от одного разговора к другому.
Люди всё чаще относятся к ИИ с недоверием и не спешат его внедрять, сказал Арул Нигам. По его словам, здоровый скептицизм полезен, но отказываться от потенциально ценного инструмента из-за опасений за безопасность было бы шагом назад.
В Circuit Breaker Labs считают, что на такие опасения нужно отвечать повышением безопасности ИИ, чтобы люди могли ему доверять.
Читайте также
«Да они из ничего появились»: размещение Firmus на миллиарды вызывает вопросы на фоне протестов против дата-центров
Эти специалисты по ИИ хотят открыто заниматься исследованиями, от которых многое зависит
Папа Лев XIV не в восторге от искусства, созданного ИИ
Атака OpenAI на Medicare выявила «технологический долг» Австралии: его погашение может дорого обойтись налогоплательщикам
Абсурдное переименование ИИ Трампом стало проверкой лояльности техноруководителей — и они её прошли
К гарантированно приватному обучению на федеративных данных
ИИ грозит разрушить многое в нашей культуре. Но больше всего мы можем потерять способность слушать
Трамп запустил чат-бот «сверхразума» на America.org, но тот сразу стал спорить с ним — в том числе о победителе выборов 2020 года
Исследование: ИИ-чатботы, которые техкомпании активно продвигают миллиардам пользователей, могут серьёзно вредить психике
ИИ обходит лицензированных бухгалтеров по скорости и точности, но без контроля всё ещё не может закрыть книги
Медики устали разгребать бардак, который устроила Palantir
Уязвимость в приложении ChatGPT для Mac могла открыть хакерам доступ к личным данным
Microsoft AI выпустила новые модели для распознавания и синтеза речи в голосовых ИИ-агентах
Не обманывайтесь: большие языковые модели не рассуждают
Индекс Ramp AI Index: компании используют ИИ активнее, но платят за него меньше
Black Forest Labs выпустила Flux 3 Image: модель редактирует изображения поэтапно, не затрагивая остальную картинку
Не стоит паниковать из-за ИИ — нужно привлекать его создателей к ответственности, когда что-то идёт не так
Shopify представила Canvas — интернет-магазины можно создавать в диалоге с ИИ
Что бы ни подразумевали под безопасностью ИИ, это точно не она
Стартап Legato выпустил очки с ИИ для помощи людям с нарушениями слуха
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram