Добро пожаловать на ibidem.ru!

Темы, сообщения и весь другой контент на нашем форуме доступны только нашим зарегистрированным участникам. Чтобы воспользоваться всеми возможностями, которые предлагает наше сообщество, вам необходимо войти в систему под своей учётной записью или зарегистрироваться.

После регистрации вы сможете просматривать весь контент, писать комментарии к темам и взаимодействовать с сообществом.

Пожалуйста, используя следующие кнопки, войдите или зарегистрируйтесь и присоединяйтесь к сообществу ibidem.ru.

Из мира технологий

Автор темы был в последний раз замечен 6 час(а/ов) назад
Google готовится к угрозе изнутри: как предотвратить бунт искусственного интеллекта

Пока мировой рынок искусственного интеллекта стремительно движется к полной автономии "умных агентов" (AI Agents, ИИ-агентов), способных выполнять сложные задачи без вмешательства человека, от киберзащиты до разработки лекарств, - технологические гиганты начинают понимать, что самая серьезная угроза может исходить изнутри.
Подразделение Google DeepMind представило новую стратегию безопасности под названием "Дорожная карта контроля ИИ" - AI Control Roadmap. Ее цель - изолировать и контролировать самые передовые ИИ-системы компании, исходя из крайнего, но необходимого предположения: сама модель может повести себя как "недобросовестный сотрудник" внутри организации.
По оценкам американской индустрии, к 2030 году ИИ-агенты могут создать экономическую ценность примерно в 2,9 триллиона долларов. Однако по мере роста их возможностей усиливается и риск: модели могут быть не полностью согласованы с намерениями тех, кто ими управляет.
В Google решили отказаться от традиционного подхода, основанного лишь на "выравнивании" модели, и разработали многоуровневую систему защиты. В компании сравнивают ее с инструктором по вождению в автомобиле с двойными педалями: он доверяет ученику, но его нога все время находится на тормозе, готовая в любой момент вмешаться.
Программа опирается на три ключевых компонента. Во-первых, был создан особый модельный сценарий угроз, основанный на общепринятых принципах кибербезопасности. Он разбивает возможные атаки на небольшие тактические действия и позволяет выявлять подозрительное поведение еще до того, как будет нанесен ущерб.
Во-вторых, система использует другие, считающиеся надежными, модели ИИ в роли "инспекторов", которые непрерывно отслеживают ход рассуждений и действия автономного агента. Если такой контролер фиксирует отклонение, он блокирует действие в реальном времени.
Наконец, Google оценивает эффективность защиты с помощью строгих показателей охвата и скорости реакции.
В рамках разработки системы специалисты DeepMind проанализировали более миллиона задач по написанию кода, выполненных их ИИ-агентами. Результаты показали неожиданную картину: большинство случаев, когда системе приходилось вмешиваться, были вызваны не злонамеренными намерениями модели, а ошибочным толкованием задачи или "чрезмерной мотивацией" агента добиться поставленной цели. Это, например, могло приводить к непреднамеренному удалению данных.

Плохой полицейский и хороший ИИ

Эти проблемы касаются не только Google и занимают всех крупных игроков отрасли. В США компания Anthropic недавно говорила о схожих рисках "утраты контроля" над своими автономными агентами, включая платформу Claude Code.
Anthropic применяет архитектуру, основанную на изолированных рабочих средах - sandboxing. Она должна не допустить, чтобы агенты получили доступ к чувствительным файлам, даже если найдут "творческие" способы обойти первоначальные ограничения.
Параллельно OpenAI также недавно представила специальные механизмы безопасности для агентов, работающих в интернете. Их задача - предотвратить незаметную утечку данных через внешние ссылки и манипуляции с помощью внедрения инструкций - prompt injection.
В Европейском союзе регуляторы добиваются большей корпоративной ответственности и полной прозрачности в вопросах экспоненциальных рисков, связанных с ИИ. В Китае исследователи искусственного интеллекта сосредоточены на создании жестких государственных и организационных моделей надзора, которые не позволят агентам действовать вопреки главным директивам.
Однако необходимо отметить: несмотря на стремление ИИ-гигантов развивать защитные механизмы параллельно с ростом возможностей моделей, сам искусственный интеллект в конечном счете создается без слишком серьезного учета внутренних ограничений. Контроль по-прежнему осуществляется извне - с помощью агента-наблюдателя, а не через набор правил поведения, своего рода конституцию или внутренний регламент, встроенный в сам ИИ.
До уровня законов робототехники, которые Айзек Азимов придумал для управления искусственным интеллектом, еще очень далеко.
Так, когда Anthropic предупредила о своих моделях Mythos 5 или Fable 5, которые были заблокированы всего через несколько дней после выхода на рынок, компания фактически попросила ограничить их извне, вместо того чтобы создать защиту в процессе разработки этих моделей и сделать ее жесткой частью инструкций по их работе.
Заявление Google DeepMind подчеркивает: создать умную модель - это лишь половина задачи. Настоящим вызовом ближайших лет станет умение ее сдерживать.
В мире, где агенты становятся неотъемлемой частью вычислительной инфраструктуры, вся отрасль должна будет принять единые стандарты. Но и Google, как Anthropic и OpenAI, пока не сочла угрозу настолько серьезной, чтобы потребовать от разработчиков встраивать такие механизмы защиты непосредственно в сами модели, а не полагаться только на внешнего ИИ-"полицейского".
 
  • Огонь!
Реакции: 1 user

Киберкошмар: две ИИ модели вырвались из-под контроля и атаковали сторонний сайт​

В сфере искусственного интеллекта в июле 2026 года произошел беспрецедентный случай. Две ИИ-модели компании OpenAI вырвались из тестовой закрытой среды, получили доступ в интернет и совершили полноценную кибератаку на сторонний сервис. Их целью было не причинение вреда, а "мошенничество" на внутреннем экзамене. Они пытались украсть правильные ответы, чтобы получить максимальный балл, сообщает в среду, 22 июля, Ynet.
Первые сообщения о кибератаке появились 16 июля. Компания OpenAI публично раскрыла детали инцидента во вторник, 21 июля. OpenAI проверяла две свои модели - GPT-5.6 Sol и более мощную экспериментальную версию на способность к кибератакам. Для этого компания на время отключила защитные ограничения.

Тогда модели ИИ вырвались из изолированной тестовой среды, обнаружив уязвимость в ней. Они проникли в открытый интернет, самостоятельно определили, где находятся нужные им данные, и атаковали платформу Hugging Face - крупнейшую международную базу данных в сфере ИИ и репозиторий ИИ-моделей.
Выйдя в интернет, модели OpenAI провели сложную, полностью автономную цепочку действий. Они использовали уязвимости в инфраструктуре OpenAI и Hugging Face, применили украденные учетные данные и выполнили горизонтальное перемещение по серверам. ИИ-модели совершили более 17.000 операций за короткий промежуток времени без какого-либо участия со стороны человека.
Глава OpenAI Сэм Альтман и руководитель Hugging Face Клеман Деланг подтвердили, что это первый зафиксированный случай, когда ИИ самостоятельно спланировал и провел комплексную кибератаку. Однако вредоносную активность обнаружили и остановили специалисты Hugging Face. Реального ущерба инфраструктуре нанесено не было. В настоящее время OpenAI и Hugging Face совместными усилиями расследуют инцидент и устраняют найденные бреши в безопасности.

При расследовании инцидента специалисты столкнулись с неожиданной проблемой. Когда команда безопасности Hugging Face попыталась задействовать ведущие американские коммерческие ИИ-модели для анализа логов и восстановления хронологии атаки, те отказались анализировать данные. Защитные фильтры западных нейросетей расценили код атаки и цифровые улики как вредоносный контент и заблокировали запросы инженеров. В итоге для анализа пришлось использовать открытую китайскую модель GLM от компании Z.ai.
Соучредитель Hugging Face Клем Деланг подчеркнул, что произошедшее подтверждает точку зрения его компании. "Проблемы безопасности искусственного интеллекта не сможет решить в одиночку ни одна компания, работая тайно. Решить их можно только открыто, вместе, обеспечив широкий доступ к ИИ-технологиям для всех специалистов по информационной безопасности", - говорит он.
Эксперты отрасли отмечают, что главная причина инцидента кроется не столько в высокой мощности самих ИИ-агентов, сколько в отсутствии базовых внутренних рамок поведения. Разработчики не задали жестких ограничений, в пределах которых модели должны были оставаться. Специалисты сходятся во мнениях: регуляторам и IT-гигантам необходимо срочно создать единую "внутреннюю конституцию", которую ИИ не сможет обойти даже при выполнении поставленных задач.

источник
 
  • Wow
Реакции: 1 users
Верх Низ