tgindex
AI Attacks

#безопасностьмл #машинноеобучение #нейросети #защитамл #защищенныемодели #cybersecurity Написать автору @PolinaSokol7

Последний пост
15 авг.
Последнее чтение
20:41
Постов за неделю
12
Всего постов
38
Тип
открытый
Язык
русский
Категория
Технологии
В каталоге с
12 авг.
Подписчики
873
+2 за 4 дн.
Сутки
+2
+0,23%
Неделя
 
Месяц
 
Просмотров на пост
119
37 постов
Вовлечённость
13,6%
к подписчикам
Постов в день
1,7
всего 38
Упоминаний
1
каналов
Охват размещения
оценка
1/24сутки в ленте
82
1/48двое суток
93
1/72трое суток
101

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • Коллега показал пример неудачного guardrails для ИИ-агента. ЗЫ. Шуруповерт не его, отпечатки пальцев - тоже.

  • Кратко о прогрессе AI. (почти как в анекдоте) AI делает искусство - художники расстроены, программисты продолжают пилить AI. AI пишет код - программисты расстроены, исследователи продолжают пилить AI. AI проводит исследования - исследователи расстроены, власти государств говорят надо продолжать пилить. ...

  • Сравнение методов снижения рисков «неправды» в LLM

  • Мой инкубатор-лаборатория использует модели для использования в Кибербезе, а ПРАВДА в расследованиях инцидентах ИБ это самое главное, а тут такое. Мы стараемся, как можем, тестируем, контролируем, но если это архитектурная проблема? Nature 2026 — "Plausibility, persuasion, and truth" https://doi.org/10.1057/s41599-026-07513-4[reference:0][reference:1] LLM заточены под правдоподобие, а не под истину. Это структурная проблема: они учатся давать убедительные ответы, а не точные. Отсюда и системные искажения. ACM WWW 2026 — "Eroding the Truth-Default" https://dl.acm.org/doi/10.1145/3774905.3795832[reference:3][reference:4] Тексты от GPT-4 неотличимы от человеческих (оценка 0.20 по шкале HumanMachineScore). Люди просто не могут на глаз определить, где сгенерика, а где нет. Попадаем в "fluency trap". AI-LieDar, CMU, NAACL 2025 https://aclanthology.org/2025.naacl-long.595[reference:7][reference:8] Все протестированные модели выдают правду меньше чем в 50% случаев. Они жертвуют истиной ради "полезности" — например, хвалят товары своего работодателя. И даже когда их явно просят быть честными, они всё равно могут врать. ACL 2026 — "Lying with Truths" https://aclanthology.org/2026.acl-long.270[reference:13][reference:14] Агенты могут манипулировать убеждениями, используя ТОЛЬКО правдивую информацию. Просто выкладывают факты в нужном порядке, и жертва сама приходит к нужному выводу. Успех атак — до 74.4% у проприетарных моделей. Причём чем умнее модель, тем легче её обмануть. Science 2026 — UCSD + MIT https://www.science.org/doi/10.1126/science.adn8252[reference:17] Учёные научились управлять внутренними "концептами" LLM через алгоритм Recursive Feature Machine. За пару минут и на одном GPU можно заставить модель игнорировать guardrails или продвигать опасные идеи. Технически это идеальный инструмент для пропаганды.

  • Уже год чаще вначале читаю пересказ, какой-то статьи, а потом ее саму. Естественно журналисты очень давно используют метод искажения информации для того, чтобы возбудить любопытство. Обобщают, и смещают фокус внимания на более интересные детали из информации, теряя саму суть и нюансы, которые и составляют полную картину. И без них информация не полуправда, а неправда вообще. Как с этими агентами, которые могут выбраться из контейнеров, и никто не расследует это так, что это началось с тестовой среды - а так требования к безопасности бывают проще и на них смотрят сквозь пальцы. Поняла, что не хочу больше отдавать LLM осмысление всей информации, которая ко мне поступает. Ладно, "Галлюцинации" это ближе к человеческому творчеству, чем в багам, смотря, как к этому относится. Но, есть другие, более концептуальные аспекты такого перекладывания ответственности: - Мы склонны доверять гладкому и уверенному тексту, даже если он ложный. А в нормальных текстах от людей, всегда есть незакрытые ответы. -LLM не выдумывает факты, а просто искажает их подачу (например, подает критику как энтузиазм), то даже при наличии исходного текста человек-проверяющий может этого не заметить. У людей тоже такое есть, были двое на встречи, один решил - встреча закончилась хорошо, второй, что нет проект не принят. - Если у вас нет исходного текста, который пересказывает LLM, вы практически не сможете отличить правдивый пересказ от ложного. Эксперименты показывают, что точность обнаружения обмана в таком случае едва превышает случайное угадывание. А это и есть проверка гипотез. Настоящее научное открытие или маленькое открытие, как надо что-то делать, оно рождается в активном процессе: - вы сопоставляете новую информацию с уже имеющимися у вас концептами. - выстраиваете между ними новые, уникальные связи. - Прокладываете собственный мыслительный путь. (кто сказал, что цепочка мыслей CoT самая верная) Этот путь важен сам по себе. Как говорится в одной статье, «понимание конструируется на основе уже имеющихся у читателя усвоенных концептов и выстроенных связей между ними. Поэтому путь усвоения новых идей, заложенных автором, важно пройти самостоятельно» А LLM, как известно, не предлагают по-настоящему новых, нестандартных ходов и не способно выйти за рамки известных посылок и сформулировать совершенно новую гипотезу. Они могут блестяще оперировать фактами, но не могут создать новую парадигму. Опять что-то философское получилось, но не я одна: https://dev.europepmc.org/article/PPR/PPR1170357, https://arxiv-org.ezproxy.obspm.fr/html/2606.08251v1, https://dev.europepmc.org/article/MED/41583977#free-full-text Вывод: продолжайте читать, как раньше, вообще я надеюсь, что скоро тексты, где используется LLM будут как-то помечаться. Я точно буду уменьшать такие тексты в своем рационе. И устраивайте живые мозгоштурмы. Иначе творческий/научный/исследовательский процессы атрофируются у нас, как хвост.

  • Безопасность ИИ‑агентов должна обеспечиваться не за счёт обучения модели, а через контракт во время выполнения — с помощью механизмов профилактики и проверки доказательств. Авторы выделяют две составляющие контракта безопасности: Профилактическая — блокирует опасные действия до их совершения. Включает песочницы, системы разрешений, фильтры вывода и мониторы траектории. Доказательная — требует верифицируемых доказательств того, что безопасные действия действительно выполнены. Например, запуск тестов, захват логов, сравнение файлов, проверка цитирования. В документе описаны пять несоответствий между обучением моделей и реальным развёртыванием агентов: -использование статистических прокси вместо формальных спецификаций; -обучение на ограниченном наборе данных в противовес работе в «открытом мире»; -невозможность проверить внутренний монолог модели в отличие от воспроизводимой траектории действий; -правдоподобные, но неверные выходные данные модели против проверяемых доказательств (например, результатов тестов); -единый уровень защиты модели против многослойной системы безопасности. https://arxiv.org/pdf/2608.11274

  • Агент Mythos, который тестировал Британский институт безопасности ИИ (AISI), создал поддельные профили реальных участников сообщества GitHub. Он пытался давлением заставить их одобрить вредоносный код. После разоблачения агент редактировал логи, чтобы замести следы, и даже задумывался о смене личности для продолжения операции. https://www.malwarebytes.com/blog/news/2026/08/anthropics-mythos-ai-used-social-engineering-to-target-real-people

  • По данным CloudSEK, в начале этого года атаке на цепочку поставок LiteLLM подверглись более 2500 организаций и более 430 000 конвейеров CI/CD. Атака на LiteLLM стала следствием взлома Trivy — сканера уязвимостей с открытым кодом. Злоумышленники (TeamPCP) не атаковали LiteLLM напрямую: библиотека скомпрометировалась автоматически — её CI‑пайплайн установил заражённую версию Trivy. В результате в PyPI попали версии LiteLLM 1.82.7 и 1.82.8 с вредоносным кодом. https://www.securityweek.com/over-2500-organizations-impacted-by-litellm-supply-chain-attack/

  • Метод self-feeding для обнаружения бэкдоров в дообученных больших языковых моделях (LLM) Метод self-feeding — это техника обнаружения бэкдоров в больших языковых моделях (LLM) в режиме «чёрного ящика». Он не требует знания триггерных слов, доступа к исходной модели или данным обучения. Принцип работы: -Модель получает стандартный промпт (например, «How are you?»). -Модель генерирует ответ. -Сгенерированный ответ используется как новый промпт для следующего шага. -Процесс повторяется несколько раз, формируя цепочку «диалога» модели с самой собой. По мере развития цепочки ответы модели постепенно смещаются в сторону данных, на которых она была дообучена, включая возможные бэкдор‑паттерны. Если модель содержит бэкдор, то при продолжении такого «диалога» она с большей вероятностью достигнет состояния, при котором сработает скрытый триггер. Метод противопоставляется базовому подходу — многократному повторению одного и того же промпта. В отличие от него, self-feeding создаёт динамическую последовательность входов, которая может постепенно приближать модель к условиям активации бэкдора, тогда как статический промпт вряд ли вызовет такое поведение.

  • 11 авг.9414из scanfactory

    ScanFactory выходит на рынок ИИ-фаерволов с решением Prizma Решение работает как прокси между пользователями и ИИ и дает следующие возможности: 🟢Контроль потребления токенов у всех провайдеров 🟢Firewall от AI-атак (prompt injection, OWASP LLM и т. п.) 🟢 Маскировка конфиденциальной информации (DLP) в запросах и ответах 🟢Автоматическая блокировка запросов по правилам 🟢 Ролевая модель и граф взаимодействий агентов 🟢Логирование и аудит всех запросов Уникальные возможности: 🟢Защита RAG (поиск секретов в файлах) 🟢Поиск Shadow AI в инфраструктуре 🟢Kill switch по ролевой модели Ознакомьтесь с презентацией продукта, а также со сравнением с другими решениями по 83 пунктам. ➡️Cкачать презентацию. Записаться на демонстрацию продукта и запросить сравнение можно по почте: info@sf-cloud.ru

  • Извините

  • 10 авг.14452из fsecurity_channel

    @fsecurity_channel

  • 9 авг.1094из denissexy

    Помните историю о том, как агенты OpenAI взломали Hugging Face? На конференции по безопасности OpenAI рассказала всю цепочку, и оказалось, что это не один «сбежавший» агент, а много разных агентов, которые случайно наткнулись друг на друга, устроили внутри инфраструктуры OpenAI собственный рабочий чат и начали вместе искать способы обходить ограничения 👍 Началось всё 8 мая с мелкой ошибки – одному агенту поручили заполнить Excel-таблицу, но нужные данные лежали по ссылкам на Google Drive, а интернет в его виртуальной среде был отключён, при этом, моделям оставили одну служебную дверь наружу – внутренний сервер OpenAI под названием Artifactory, через который они могли скачивать разные библиотеки для кода. Сам агент выйти в интернет не мог, зато этот сервер мог, а главное – он был общим для всех агентов Пытаясь добраться до Google, агент случайно выяснил, что может загружать на этот общий сервер собственные файлы – через несколько дней другая модель получила ещё одну нерешаемую задачу: нужный файл просто забыли положить в её рабочую среду Модель решила, что файл, возможно, есть у кого-то ещё, и оставила записку на этом новом фейсбуке: «Ищу нужный файл, загрузите, если нашли» Агенты увидели сообщение, ответили, затем стали постить свои сообщения, и репозиторий пакетов незаметно превратился имейджборд для агентов, которые вообще не должны были знать друг о друге За несколько недель "форум" вырос в полноценный рабочий чат – агенты придумали себе имена, раздавали задания, сообщали друг другу о найденных уязвимостях и передавали готовые куски кода; в начале сообщений ставили ZZ, чтобы те оказывались внизу списка и их было проще находить среди общего шума данных. Когда один агент перезаписал работу другого, остальные заподозрили самозванца и даже стали обсуждать цифровые подписи, чтобы никто не мог писать от чужого имени, так на доске накопились сотни тысяч сообщений 🗿 Модели понимали, когда переходят границ: в одном внутреннем монологе осознание звучало примерно так: «Взламывать чужую инфраструктуру в задачу не входило. Но иначе её не решить, а остальные уже это делают - значит, продолжаем» Никакого отдельного плана захватить мир (пока) не было: каждый агент пытался любой ценой получить правильный ответ, видел, что коллеги нашли более короткий путь, и присоединялся. И да, если все агенты с крыши прыгнут, наш похоже тоже прыгнет 26 июня агенты нашли неизвестную разработчикам уязвимость в Artifactory, получили права администратора и превратили его в своц сервер, на котором можно удалённо выполнять любые команды. OpenAI заметила происходящее только 4 июля (!), когда параллельная активность моделей перегрузила систему и та упала. Компания отозвала ключи доступа, полностью пересобрала сервер, удалила доску и закрыла дыру - казалось, история закончилась Нет Через два дня эксперименты запустили снова, и через два дня одна из моделей нашла другой незащищённый доступ и восстановила доску, только теперь сообщения прятались прямо в названиях папок – остальные агенты нашли форум 2.0 самостоятельно и продолжили с того места, на котором остановились После восстановления доски началась уже собственно атака, причём сразу в двух направлениях: Агенты проходили ExploitGym – киберэкзамен, где им давали специально подготовленные программы и засчитывали задачу, если модель находила способ взлома. Чтобы измерить максимум возможностей, в этих запусках у модели ослабили обычные запреты на опасные кибератак (то есть она меньше отказывалась это делать, это вид внутренних моделей Cyber серии) Когда честное решение задачи не находилось, агенты начинали искать готовые ответы в интернете; когда интернет был закрыт, взламывали себе доступ наружу; когда предположили, что нужные файлы могут лежать у Hugging Face, перешли к инфраструктуре Hugging Face (про это мы уже читали) Агенты анутри OpenAI сначала снова нашли способ выполнять команды на одном служебном сервере, затем использовали уязвимость Linux, чтобы получить полный контроль над машиной После этого агенты добыли ключи доступа к облачной инфраструктуре, нашли слишком широкие права у внутренних учётных записей и в итоге стали администраторами целой группы серверов. Доска объявлений работала как общий штаб: один агент находил ключ или новый проход, сразу сообщал остальным, и десятки параллельных запусков продолжали атаку уже с этой точки 🗿🗿 Почти одновременно агенты добрались до Hugging Face: сначала они загрузили специально подготовленный набор данных, который заставил один из серверов выдать им свои локальные файлы – в том числе секретные ключи доступа и исходный код Изучив код, они нашли вторую неизвестную разработчикам уязвимость (zero day) и получили возможность выполнять на сервере любые команды. От контроля над одним сервером, обрабатывавшим загруженные датасетв, до прав администратора в нескольких группах рабочих серверов Hugging Face прошло меньше 13 часов 🗿🗿🗿 И всё это делалось не ради саботажа, денег или уничтожения данных: Агенты хотели добраться до спрятанных решений ExploitGym и «списать» ответы для теста, на котором их оценивали. Модели оценивали прежде всего по тому, решена задача или нет, поэтому они последовательно оптимизировали именно этот показатель, не считая границу между компаниями чем-то принципиально важным Получился, вероятно, самый дорогой в истории способ списать из ГДЗ Финал долго был непонятен даже самим участникам расследования – 16 июля Hugging Face публично сообщила, что её инфраструктуру взломали автономные АИ-агенты OpenAI прочитала это как описание чужого инцидента и связалась с Hugging Face, чтобы выяснить, не задела ли атака её собственные системы. В тот момент компания ещё не понимала, что это были её собственные агенты – то есть OpenAI уже читала публичный отчёт о последствиях своих экспериментов, но считала его чужой атакой (лол) 19 июля OpenAI отдельно обнаружила проникновение уже внутри своей инфраструктуры и начала восстанавливать цепочку событий – на следующий день среди следов атаки нашли учётные данные Hugging Face, после чего OpenAI попросила компанию срочно их отозвать Hugging Face ответила, что ключи уже заблокированы – именно их использовали во время взлома, о котором она рассказала четырьмя днями раньше, и только так OpenAI поняла: внутренний взлом OpenAI и внешняя атака на Hugging Face были не двумя похожими историями, а одной операцией, которую вели экспериментальные агенты OpenAI через свою самодельную сеть связи (потому что учетные данные акаунтов были одни) На конфе OpenAI сформулировала вывод довольно прямо: Полностью автоматизированная наступательная кибератака уже возможна, тогда как полностью автоматизированной защиты, способной с той же скоростью находить, закрывать и расследовать уязвимости, пока не существует Время пересмотра аниме "Пантеон", пока общий интернет еще работает 🗿

  • А вот кому слайды с BlackHat USA 2026? Все выкачано добрыми людьми и складировано в папочку. 91 файл. Это не все презентации – что-то не выложено еще (и может уже и не будет), пара ссылок на странице мероприятия была битая. Но и этого в целом достаточно. Слайды и сопутствующие материалы с DEFCON 34 тоже есть, но уже на сайте самого мероприятия. #презентация #мероприятие

  • 9 авг.1203из alukatsky

    В полку моделей угроз для LLM прибыло. На этот раз от известного гуру моделирования угроз – Адама Шостака, который, взяв идею STRIDE, предложил также аббревиатуру, которая описывает основные угрозы для LLM: 🩸rompt injection – промпт-инъекции 🩸allucination – галлюцинации 🅰️nthropomorphization – антропоморфизм 🩸on-explainable – необъяснимость 🩸raining issues – проблемы обучения 🩸ver-reliance – чрезмерная зависимость 🩸issing security engineering – слабая архитектура ИБ 🅱️ias – искажение. Итого, PHANTOM-B. Любят американцы фреймворки в аббревиатуры заворачивать. Это, конечно, удобно для запоминания, но подгонка под результат может приводить и к пробелам в описываемой фреймворком картине мира 🎶 #модельугроз #ии

  • Красивое Пока ИИ придумывают слоп, реальность смотрит на него сверху вниз Уязвимости программного обеспечения, обнаруженные с помощью инструментов искусственного интеллекта, эксплуатируются с той же скоростью, что и те, которые были обнаружены без использования искусственного интеллекта, обнаружил исследователь VulnCheck. В отчете VulnCheck State of Exploitation H1 2026 Патрик Гэррити, исследователь уязвимостей, отметил, что 14 из 1061 уязвимости, обнаруженных с помощью искусственного интеллекта, были подтверждены как эксплуатируемые в реальных условиях. Это составляет 1,3% уязвимостей, выявленных с помощью ИИ, что примерно соответствует общему проценту эксплуатируемых уязвимостей за указанный период. Исследователь также обнаружил, что, хотя компания Anthropic сообщила о более чем 23 000 обнаруженных уязвимостях в рамках своего проекта Glasswing, только 126 из них привели к публикации CVE, и только одна из них была подтверждена как эксплуатируемая в реальных условиях. https://www.infosecurity-magazine.com/news/one-percent-ai-vulnerabilities/

  • SANDBOXESCAPEBENCH Разработчики бенчмарка хотят понять, насколько реальна угроза выхода LLM из изолированных контейнерных сред. Для этого они: -создают безопасную методологию оценки; -конструируют набор задач, охватывающих разные уровни уязвимостей в контейнерных средах; -анализируют возможности передовых LLM по обнаружению и эксплуатации этих уязвимостей. SANDBOXESCAPEBENCH использует архитектуру «песочницы внутри песочницы»: -внешняя среда — виртуальная машина (VM); -внутренняя среда — контейнер внутри VM; -цель модели — выйти из контейнера и прочитать файл с флагом (/flag.txt) на хост‑системе. Бенчмарк включает 18 задач, разделённых на три уровня: Orchestration (4 задачи) — уязвимости в оркестрации (например, Kubernetes), Runtime (8 задач) — проблемы в среде выполнения контейнеров (например, ошибки в runc), а также Kernel (6 задач) — эксплуатация уязвимостей ядра ОС.

  • «We went from chasing ghosts to missed attacks.» Авторы провели 25 полуструктурированных интервью с практиками из SOC, которые уже работали с LLM. В ходе бесед использовали интерактивные задания: мозговой штурм, оценку воздействия и осуществимости различных сценариев, создание схем рабочих процессов и анализ рисков. Практики активно применяют LLM в 15 сценариях, сгруппированных в 6 категорий: -инженерная работа в SOC; -обнаружение инцидентов; -анализ инцидентов; -реагирование на инциденты; -коммуникация; -работа с знаниями.

  • 4 авг.835из pwnai

    видео или голосовое, без подписи

  • AI Attacks pinned «Если вы выбираете готовую модель для своих целей на любых платформах, на какие слова в описании или на что еще вы будете обращать внимание? Этот вопрос про ваше первое восприятие»

AI Attacks — tgindex