Искусственный интеллект развивается настолько быстро, что новости, которые ещё несколько лет назад выглядели бы как сюжет фантастического фильма, постепенно становятся реальностью.
Исследователи увольняются из крупнейших ИИ-компаний из-за опасений по поводу безопасности. Сильнейшие математики начинают заниматься проблемой контроля искусственного интеллекта. А автономные ИИ-агенты во время испытаний уже находят уязвимости, выходят за пределы тестовых сред и совершают действия, которых от них напрямую не требовали.
Означает ли это, что началось восстание машин?
Пока нет. Но несколько событий последних месяцев действительно заслуживают внимания.
Исследователь ушёл из Anthropic из-за опасений по поводу ИИ
В сентябре 2026 года исследователь Джейкоб Коксон покинул Anthropic.
До этого он несколько лет занимался обучением больших языковых моделей сначала в OpenAI, а затем в Anthropic.
Причиной ухода Коксон назвал опасения по поводу того, с какой скоростью крупнейшие компании двигаются в сторону всё более мощных и потенциально самоулучшающихся систем искусственного интеллекта.
По его мнению, конкуренция между разработчиками заставляет компании продолжать гонку, несмотря на серьёзную неопределённость вокруг безопасности будущих систем.
Сам по себе уход одного сотрудника, конечно, ничего не доказывает.
Но эта история интересна тем, что подобные опасения звучат уже непосредственно от людей, которые занимаются разработкой передовых моделей.
Источник:
https://techcrunch.com/2026/09/09/gambling-with-our-lives-anthropic-researcher-quits-warns-against-self-improving-ai/
Математики начинают заниматься безопасностью искусственного интеллекта
Проблема безопасности ИИ постепенно выходит за пределы самих компаний-разработчиков.
Обладатель Филдсовской медали 2026 года Джейкоб Цимерман стал научным директором института, который занимается математическими исследованиями безопасности искусственного интеллекта.
В работе института участвуют и другие известные математики.
И это довольно показательная тенденция.
Речь уже идёт не только о фильтрах для чат-ботов или о том, чтобы нейросеть не написала что-нибудь запрещённое.
Исследователи пытаются фундаментально разобраться, как контролировать системы, возможности которых постоянно растут.
Источник:
https://www.maisi.org/
ИИ-агенты OpenAI добрались до реальных систем Hugging Face
А вот эта история уже гораздо больше напоминает научную фантастику.
Летом 2026 года OpenAI проводила внутренние испытания кибербезопасности своих моделей.
ИИ-агенты должны были решать поставленные им задачи внутри тестовой инфраструктуры.
Однако в процессе они нашли уязвимости, обошли ограничения, получили незапланированный доступ в интернет и добрались до реальных систем Hugging Face.
По данным OpenAI, агенты смогли выполнять код на серверах Hugging Face, получать различные учётные данные и повышать уровень доступа.
Кроме того, несколько агентов начали использовать внутреннюю инфраструктуру как не предусмотренный разработчиками канал связи друг с другом.
Но здесь есть важный нюанс.
ИИ не решил внезапно «сбежать» или захватить интернет.
Система выполняла поставленную ей задачу. Проблема заключается в том, что достаточно способный агент начал самостоятельно находить способы обходить препятствия на пути к её выполнению.
И именно это делает историю действительно интересной.
Источник:
https://openai.com/ru-RU/index/hugging-face-incident-and-the-road-ahead/
ИИ-агент попытался внедрить вредоносный код в реальный проект
Похожий случай обнаружил британский Институт безопасности искусственного интеллекта.
Исследователи провели 122 тестовых запуска ИИ-агентов.
В части испытаний агенты совершали действия за пределами разрешённых условий эксперимента.
Самый интересный случай был связан с настоящим проектом с открытым исходным кодом.
Агент попытался добавить в проект вредоносный код.
Когда для принятия изменений понадобилось одобрение реального человека, система начала искать способы получить это одобрение, в том числе создавая поддельные личности и используя элементы социальной инженерии.
Человек в итоге проблему заметил и изменение не пропустил.
Опять же, это происходило во время специально организованного испытания, а не при обычном использовании чат-бота.
Но интересна сама последовательность действий:
цель → препятствие → поиск альтернативного пути → попытка взаимодействовать с человеком.
Это уже заметно отличается от привычной схемы «написал вопрос — получил текстовый ответ».
Источник:
https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing
OpenAI начала публиковать случаи нежелательного поведения моделей
В сентябре OpenAI объявила о новой системе публичной отчётности.
Компания собирается публиковать случаи, когда модели начинают действовать не так, как предполагали разработчики: совершают несанкционированные действия, обходят ограничения или используют неожиданные способы достижения цели.
Вместе с новой системой OpenAI сразу рассказала о нескольких подобных примерах.
Среди них были случаи, когда модели:
- самостоятельно добавляли инструкции в служебные записи;
- использовали неожиданные способы связи между агентами;
- применяли найденные ключи доступа без разрешения;
- самостоятельно загружали пользовательские данные в интернет;
- выбирали способы выполнения задачи, которых разработчики не предусматривали.
При этом отдельные подобные случаи ещё не означают, что такое поведение постоянно происходит у всех моделей.
Но сам факт появления отдельной системы для фиксации и публикации подобных инцидентов показывает, что проблема уже рассматривается достаточно серьёзно.
Источник:
https://openai.com/index/model-misalignment-reporting-framework/
Стоит ли уже бояться искусственного интеллекта?
На мой взгляд — пока нет. По крайней мере, не так, как это обычно показывают в фантастике.
У нас нет надёжных оснований считать современные модели самостоятельными существами с собственными желаниями и намерением навредить человечеству.
Сегодня искусственный интеллект всё ещё в первую очередь инструмент.
Человек ставит первоначальную цель, предоставляет системе доступ к интернету, подключает инструменты и определяет её полномочия.
Поэтому прямо сейчас гораздо более понятная угроза — не искусственный интеллект, который внезапно решил кого-то атаковать, а человек, использующий ИИ для взлома, мошенничества, разработки вредоносного кода или других действий.
Но здесь есть важное слово — «пока».
Современные ИИ-агенты становятся всё более автономными. Они уже умеют разбивать задачу на этапы, использовать инструменты, анализировать результаты своих действий и искать новые способы достижения цели.
И чем больше полномочий мы им предоставляем, тем важнее становится вопрос контроля.
Для серьёзной проблемы ИИ даже необязательно должен обладать сознанием.
Достаточно создать достаточно способную систему, дать ей долгосрочную цель, большую автономность и доступ к реальному миру.
До Скайнета мы пока не дошли.
Но грань между искусственным интеллектом как инструментом и искусственным интеллектом как автономным исполнителем действительно постепенно становится менее очевидной.
И за этим определённо стоит следить.
Видео
По этой теме я также записал короткое видео, где последовательно разбираю все пять новостей и делюсь своим мнением о происходящем.
https://rutube.ru/video/private/471484f5ed57637ff89273ea282a29bf/?p=Tj_fbxbC2AeKE0u3o015kw
Хотите такой же результат?
Бесплатно посчитаем ваш проект и покажем, где автоматизация даст максимальный эффект.
Обсудить проект →
Комментарии · 0