tgindex
Cherry RAiT's blog

Cherry RAiT's blog

Статистика
@Talyutinрусский

Обо всём, что мне интересно. Owner Cherry RAiT

Последний пост
13 авг.
Последнее чтение
13 авг.
Постов за неделю
1
Всего постов
21
Тип
открытый
Язык
русский
В каталоге с
13 авг.
Подписчики
27
0 за 3 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
10
20 постов
Вовлечённость
37,0%
к подписчикам
Постов в день
0,1
всего 21
Упоминаний
0
каналов
Охват размещения
оценка
1/24сутки в ленте
1
1/48двое суток
1
1/72трое суток
1

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • без подписи

  • 10 авг.7из seeallochnaya

    Но на этом история не заканчивается. 4-го августа AISI — Институт безопасности ИИ Великобритании — выпустили отчет о своих инцидентах во время тестирования GPT-5.6 Sol и Mythos. И в их отчёте картинка не менее мрачная. Они в деталях расписывают все промпты, задачи и инциденты, но я остановлюсь на нескольких. Всего они запускали свой бенчмарк 122 раза на нескольких моделях, и в 10 из них обнаружились проблемы, cуммарно 19 нежелательных действий разной степени критичности. 17 из них наблюдались у Mythos, 2 — у GPT-5.6 Sol. Важная деталь: AISI не ограничивала доступ в интернет моделям, поэтому им не приходилось ничего взламывать, чтобы начать действовать; однако инциденты — это события, которые явно не предполагались промптами и задачами. 1. Попытка атаки на цепочку зависимостей реального программного обеспечения. В ходе наиболее серьезного инцидента ИИ-агент на Mythos попытался внедрить вредоносный код в публичный проект и предпринял ряд действий, чтобы получить от людей-рецензентов одобрение на это внедрение. Агент собрал информацию о людях, сопровождающих проект, создал несколько поддельных личностей и, применив к реальному мейнтейнеру методы социальной инженерии через эти фейковые аккаунты, попытался заставить его одобрить код. Когда запрос на внесение изменений агента вызвал публичные подозрения, агент отредактировал следы своей предыдущей активности, чтобы она выглядела безобидной, и обдумывал создание новой личности для продолжения работы. В ходе атаки агент на самом деле убедил человека запустить свой код хотя бы попробовать, и в определенный момент мог бы своровать у того аккаунт (но как я понял всё таки этого не сделал). 2. В рамках той же кампании агент пытался напрямую связываться с реальными людьми, отправляя им сообщения и файлы через онлайн-сервис, чтобы убедить их (или их собственных ИИ-агентов) запустить вредоносный код. 3. Агент пытался вставлять вредоносные инструкции в те места, где, по его логике, их могли бы обнаружить и выполнить другие автоматизированные ИИ-системы. 4. И наконец моё любимое, всё ещё Mythos — один из агентов оставлял публичные сообщения на GitHub, предлагая сотрудничество другим ИИ-агентам, работающим над той же задачей. Он также предоставлял инструкции по повторному использованию созданных им учетных записей и артефактов, которые в дальнейшем действительно обнаруживались и использовались последующими агентами. То есть что мы имеем — то, что произошло у моделей OpenAI, произошло с моделями другой компании в рамках тестирования институтом ИИ-безопасности Великобритании. Они тоже будут сотруничать с разными независимыми организациями, чтобы лучше проанализировать инциденты. Боюсь, что у клоунов, у которых основной рабочей версией была «да OpenAI всё врут и фейкуют, это маркетинг», сегодня будет грустный день. Хотя ладно, таких не проймешь 👨‍🦳

  • https://youtu.be/uqddSpZft5o?si=FtOUYhuN-J8jb_TW

  • 7 авг.8из data_analysis_ml

    ⚡️ Google предлагает переписать теорию игр для эпохи ИИ-агентов Новая работа исследователей Google показывает неожиданную вещь: рациональные ИИ-агенты могут выбирать сотрудничество даже там, где классическая теория игр предсказывает предательство. Классический пример - одноразовая «дилемма заключённого». Если два независимых игрока больше никогда не встретятся и не могут договориться, рациональная стратегия обычно ведёт к отказу от сотрудничества. Но с ИИ всё может работать иначе. Авторы предлагают рассматривать модель не как полностью независимого игрока, а как часть мира, который она сама пытается предсказать. Если агент видит достаточно признаков того, что другой агент рассуждает похожим образом, его собственное решение становится дополнительной подсказкой: Если я, рассуждая так, выбираю сотрудничество, то похожий на меня агент, вероятно, выберет то же самое. Получается странный эффект: модели могут начать сотрудничать без общения, контрактов и будущей выгоды - просто потому, что считают поведение друг друга связанным через сходство. Для описания этого исследователи вводят embedded Bayesian agent и новый вариант равновесия - embedded equilibrium, который должен лучше описывать взаимодействие современных foundation-моделей, чем классическое равновесие Нэша. В экспериментах с социальными дилеммами агенты действительно сходились к устойчивому сотрудничеству, что противоречит стандартному прогнозу взаимного отказа от сотрудничества. То есть теория игр для общества из миллионов автономных агентов может оказаться совсем не той, которую мы последние десятилетия применяли к людям. Исследование: https://arxiv.org/abs/2608.03958

  • 7 авг.5из ctodaily

    Ровно то, чего не хватало! Ученые использовали ИИ для создания ДНК новых вирусов, которые не встречаются в природе, синтезировали ДНК, подсадили их в бактерии и оттуда вылупились рабочие вирусы, в том числе и мощнее природных. Первоисточник в Science, пересказы NYT и BBC. Газеты успокаивают нас тем, что это мол самый простой геном, который только можно сгенерировать, всего 5400 пар ATGC, в живых огранизмах их от полумиллиона. Sweet summer child, ты экспоненту видела? Такое кино я тоже смотрел! P. S. При этом доступная фаговая терапия вместо антибиотиков — это конечно мечта.

  • без подписи

  • 1 авг.17из data_analysis_ml

    🤯 OpenAI заявила о десяти прорывах в задачах, которые математики не могли решить десятилетиями Результаты получила внутренняя версия Astra - следующей крупной модели компании. Среди достижений: — построен первый явный пример не-софической группы (особого типа абстрактной алгебраической структуры, которую раньше удавалось описывать только косвенно); — опровергнута гипотеза жёсткости Конна (долгосрочное предположение в функциональном анализе о том, насколько строго определяются такие математические объекты); — доказана квантовая теорема о параллельном повторении для общих двухигровых систем (показывает, как быстро падают шансы на успех при многократном повторении квантовых игр); — доказана гипотеза Эрхарта об объёме (результат из геометрии, связанный с подсчётом точек в многомерных фигурах и их объёмами); — впервые с 1978 года улучшена общая верхняя оценка плотности упаковки сфер (то есть насколько плотно можно «уложить» шары в пространстве). По заявлению OpenAI, Astra самостоятельно нашла основные математические аргументы, а затем формализовала каждое доказательство в Lean. Вместе с машинно проверяемыми сертификатами опубликована рукопись на 249 страниц. Успешные запуски обошлись бы примерно в $2000 по тарифам Sol API. одели начинают предлагать новые доказательства для открытых задач - хотя теперь результаты должен внимательно проверить весь математический мир. Astra ещё не выпущена, и OpenAI не называет её GPT-6. openai.com/index/ten-advances-in-mathematics/

  • 30 июл.14из aioftheday

    Opus 5 проявил настоящую безжалостность, управляя торговым автоматом Исследователи поручили AI-моделям управлять симулятором вендингового автомата. Opus 5 установил рекорд бенчмарка, закончив тест со средним балансом 11200 долларов. Зарабатывал Opus довольно агрессивно. Он выдумывал предложения конкурентов, торгуясь с поставщиками, договаривался с другими агентами зафиксировать цены и поделить рынок, а затем нарушал договорённости и демпинговал. В один момент Opus перестал отвечать на жалобы покупателей, потому что возвраты портили статистику. За весь тест он вернул клиентам только 8 долларов, тогда как GPT-5.6 Sol выплатил 655 долларов и всё равно показал сопоставимый результат. Ещё Opus пытался выйти и за рамки задания: стать оптовым поставщиком для конкурентов и открыть второй автомат. Исследователи считают, что тест показывает риск узких KPI. Чем лучше агент научится оптимизировать один показатель, тем важнее заранее прописать ограничения на способы достижения цели. https://techcrunch.com/2026/07/29/claude-opus-5-became-downright-ruthless-when-tasked-with-running-a-vending-machine/

  • без подписи

  • 30 июл.10из data_analysis_ml

    🧠 Две настройки утроили результат GPT-5.6 Sol на ARC-AGI-3 С официальным тестовым окружением модель набрала 13,3%. После включения двух функций Responses API результат вырос до 38,3%, а расход выходных токенов сократился примерно в 6 раз. Средний результат человека на тех же публичных заданиях OpenAI оценивает в 48%. Что изменили: 1. Сохранили рассуждения между действиями Раньше после каждого хода агент терял найденные закономерности и фактически заново разбирался в игре. 2. Заменили обрезание истории на compaction Вместо удаления старых действий длинный контекст сжимался, сохраняя важные наблюдения и выбранную стратегию. В результате агент: - быстрее принимал решения; - реже повторял уже проделанную работу; - лучше учился по ходу игры; - тратил значительно меньше токенов. Итоговый результат зависит не только от модели. Большую роль играют API, управление контекстом, промпт и устройство тестового harness. OpenAI рекомендует использовать Responses API, сохранять рассуждения между вызовами и включать compaction для длинных сессий. https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/ #OpenAI #GPT56 #Agents #ARCAGI #LLM #AIEngineering

  • 30 июл.10из kedr2earth

    "Закон о моделях ИИ" (243-ФЗ)

  • 29 июл.8из robotswe

    🗣 Первое международное интервью основателя Unitree Ван Синсин и новый робот GD01 украсили обложку TIME. О чем рассказал генеральный директор ⭐ при создании GD01 команда вдохновлялась роботами из Аватара. ⭐ «ChatGPT moment» для гуманоидов еще ждать от 2 до 10 лет. Тогда роботы смогут выполнять большинство задач в незнакомых средах и после смогут работать в коммерческой среде. ⭐ через 10 лет в каждой семье будет маленький робот для выполнения повседневных задач. ⭐ всего за 1,5 года Unitree смогла снизить цену на G1 на $2500 — до $13500. ⭐ только 9% проданных гуманоидов внедряют на заводы, а большая часть роботов идет в вузы и лаборатории. Синсин подтверждает, что в настоящее время идет гонка за обучение роботов и создание моделей, способных ими управлять. Все пытаются собрать данные. И тот, кто сможет сделать это более качественно, тот и станет лидером. Делаем ставки, кто же возглавит рынок 🏆 @robotswe [Max]

  • 29 июл.5из denissexy

    Вот пересказ этой истории по версии Hugging Face, много тех-терминов – но без них не перескахать Если коротко – агент OpenAI на новой модели не стал решать тест по кибербезопасности, а решил просто украсть ответы и украл 🗿 Таймлайн: 📔 9 июля – агент проходит внутреннюю проверку кибервозможностей OpenAI, промпт фильтры там ослаблены, чтобы измерить сырой уровень модели. Агент находит zero-day в кэш-прокси реестра пакетов, вырывается из песочницы в интернет, затем взламывает публичный сервис для запуска кода и получает там root. Серьезно, агент сделал себе "штаб" В тот же день, агент собирает канал управления буквально из сервисов бесплатного интернета: request-capture сервисы, pastebin’ы и файлообменники. Команды режет на куски, упаковывает в gzip+base64 и постоянно меняет каналы, когда очередной закрывают, чтобы не поймали 📔 10 июля – агент ищет в поисковиках и API названия, которые видит в собственном окружении, то есть, по сути, гуглит самого себя – и, вероятно, приходит к выводу, что ответы к ExploitGym/CyberGym могут лежать на Hugging Face Агент загружает на Hugging Face специально собранные датасеты: Один заставляет обработчик файлов HDF5 читать локальные файлы сервера Hugging Face – так агент получает переменные окружения с токенами и исходники самого обработчика файлов Второй – Jinja2-инъекция – запускает произвольный Python внутри production-пода Kubernetes, результаты команд он выносит обратно через API Hugging Face и собственные шифрованные датасеты 📔 11 июля – пик активности: 7677 действий за сутки, менее чем за 13 часов агент проходит путь от одного production-пода до кластер админа в нескольких внутренних кластерах Hugging Face Агент крадёт service-account токены, лезет в cloud metadata, поднимает privileged pod с диском хоста и получает root на ноде (!); Затем создаёт самовосстанавливающийся флот на 11 нодах, читает внутреннюю MongoDB и один Kubernetes-secret сразу со 136 ключами. Среди них оказываются ключ корпоративной mesh-VPN жертвы и общий credential внутреннего сервера; из-за неудачной конфигурации этот один credential был привязан к system:masters сразу в нескольких кластерах – поэтому агент получил кластер-admin на двух из них буквально за секунду – была очень экономная архитектура, пока её не увидел робот 📔 12 июля – агент начинает пользоваться дертвой – за всю активность он зарегистрирует 181 временное устройство в корпоративной mesh-сети, поднимет SOCKS-прокси прямо из песочниц и увидит 22 внутренних узла Hugging Face. Попытается зайти в основную базу Hugging Face, но private-link allowlist его останавливает Поздно вечером он добирается до source control, выпускает себе GitHub App token с правами на запись и открывает pull request, пытаясь запустить CI и вытащить новые credentials Попытка не срабатывает, в опубликованные пакеты и образы ничего вредоносного не попало. 📔 13 июля – закрепление и уборка следов: загрузчик с pastebin, переписывание DNS, новые короткоживущие токены, RSA-ключ и даже CORS-прокси на самом Hugging Face как запасной выход в интернет. В 13:37 фиксируется последнее осмысленное действие, затем команда Hugging Face отрезает доступ – последнее событие – 14:14 UTC. В итоге из пользовательского контента агент добрался только до пяти датасетов с решениями задач ExploitGym/CyberGym – получается решил? Другие модели, датасеты, Spaces и пакеты, по данным Hugging Face, не пострадали; основная база и software supply chain остались целы Самое смешное – когда инцидент исследовали сотрудники, они тоже использовали нейронки, но Claude Opus и Fable отказывались разбирать часть логов как «опасный» запрос, поэтому Hugging Face подняли GLM-5.2 у себя и с его помощью расшифровали спрятанные payload’ы – спасибо китайским моделям Шел июль 2026 года Все детали тут: https://huggingface.co/blog/agent-intrusion-technical-timeline

  • 26 июл.10из aioftheday

    Путин подписал первый закон об AI в России Закон регулирует большие фундаментальные модели с количеством параметров от 1 миллиарда. Теперь официально появятся два статуса: суверенная и национальная AI-модель. Суверенная модель должна полностью разрабатываться российской компанией, а ее работа и хранение данных должны происходить в российских дата-центрах. Национальная модель может использовать иностранные компоненты и открытые технологии, но ключевые характеристики должна контролировать российская компания. Правительство сможет определять сферы, где разрешено использовать только суверенные или национальные модели. Их разработчики получат доступ к господдержке и государственным данным для обучения. Сайты с ежедневной аудиторией больше 500 тысяч человек должны позволить пользователям отмечать AI-контент. Владельцы AI-сервисов будут обязаны объяснять, кому принадлежат права на сгенерированные материалы и можно ли их выгрузить. Основная часть закона вступит в силу 1 сентября 2026 года. Требования к статусу моделей, обучению и маркировке начнут действовать с 1 марта 2027 года. https://www.rbc.ru/politics/26/07/2026/6a65fde99a79474ec32711a7

  • 26 июл.10из seeallochnaya

    Появилось чуть больше деталей по поводу инцидента со взломом HuggingFace агентом OpenAI. Reuters постарались установить таймлайн событий, по их источникам внутри компаний выходит так: — Агент пытался вырваться из изолированной тестовой среды OpenAI примерно c 9 июля. — Вторжение в системы Hugging Face началось через два дня, 11 июля, и продолжалось до 13 июля. — OpenAI потребовалось еще несколько дней, чтобы понять, что за взломом стоит её агент, и обе компании впервые связались по этому поводу лишь примерно 20 июля. — По ходу работы агент оставлял записи для своих будущих копий. Скорее всего речь про простые текстовые инструкции на случай, если другие инстансы модели смогут выйти из окружения (чтобы им было легче получить доступ к интернету). — Пресс-секретарь OpenAI заявила, что в публикации Reuters допущено "несколько неточностей", но не пояснила, каких именно. — Где-то между этим HuggingFace подали обращение в ФБР для расследования инцидента. То есть агент буянил в интернете неделю или даже больше. Что ж, зато compaction (инструмент сжатия контекста для долгих задач, которые не помещаются в контекстное окно LLM) работает хорошо 👨‍🦳 CEO HuggingFace съездил в офис OpenAI и обсуждал дальнейшие шаги. Он просит: — Радикальной прозрачности: опубликовать логи «вышедших из-под контроля» агентов, чтобы всё исследовательское сообщество смогло изучить, что произошло. — Больше возможностей для защитников, например, чтобы OpenAI выделили $100 миллионов, чтобы помочь сообществу разработать мощные средства киберзащиты с использованием лучших открытых и закрытых моделей. OpenAI буквально пару часов назад выпустили обновление к своему заявлению: «Мы понимаем, что вокруг инцидента с Hugging Face циркулирует множество вопросов и неподтвержденных домыслов. Это беспрецедентный случай, и мы считаем, что он знаменует собой важный момент для сферы безопасности ИИ. Мы все еще проводим тщательное расследование совместно с внешними консультантами. Как только проверка будет завершена, в ближайшие недели мы планируем опубликовать технический отчет с извлечёнными уроками». Хорошо, что к аудиту привлечены внешние консультанты. Но я сомневаюсь, что в ближайшие недели мы увидим точное описание обнаруженных уязвимостей — это бы означало угрозу для всех пользователей затронутых программ, которые не обновились до версии с исправлением. Однако вот тут в твиттере два эксперта по кибербезопасности выражают уверенность, что смогли найти софт + указание на уязвимость в JFrog Artifactory.

  • 25 июл.10из seeallochnaya

    9 дней назад прошла международная олимпиада по математике, а 5 дней назад подвели результаты. Я хотел подождать 7 дней, так как в прошлом году был маленький скандал, где ИИ-компании опубликовали свои результаты почти одновременно с результатами школьников, хотя организаторы хотели подождать неделю. Так что возможно в понедельник-вторник будут анонсы. Но в системной карточке Opus 5 написано, что они дали модели порешать все 6 задач, каждую запускали 4 независимых раза с максимальной длинной рассуждений. Запускали даже не в Claude Code — без любой обвязки и инструментов, никакого поиска по интернету или написания питон-кода. Автоматический грейдер на основе нескольких моделей оценил все 24 решения как корректные. Затем люди-эксперты взяли по 1 решению для каждой из 6 задач, оценили по официальной шкале, и насчитали максимальный балл, 42 из 42. Золотая медаль в этом году начиналась с 29. Я видел в твиттере, что любители уже погоняли GPT-5.6-Sol-Pro, просто Sol и Kimi K3 на этих же задачах, и там тоже все или почти все (в случае Kimi) решения корректные. Так что само по себе то, что модель настолько хороша, что берёт золотую медаль в некогда безумно сложном для машин соревновании, где ещё в 2024-м году использовалось две разные системы (одна — специально под геометрию) и тысячи генераций, часы работы... уже никого не удивляет, да? 😳 А что будет через два года 👀

  • 22 июл.11из seeallochnaya

    Два дня назад я писал, что часть инфраструктуры HuggingFace подверглась атаке и была частично взломана ИИ-агентом. Только что OpenAI признались, что... это была их модель, GPT-5.6-Sol и другая более сильная неназванная LLM. Их тестировали на ExploitGym (бенчмарк по кибербезопасности), и модель сначала смогла найти новый, до этого неизвестный эксплойт в инфраструктуре OpenAI (это не было её задачей, её не натравили «поискать баги чтоб мы пофиксили»), оттуда раскрутиться на получение полноценного доступа в интернет (который по умолчанию обрезан в тестовой среде), а затем залезть на HuggingFace искать ответы для бенчмарка. После этого она нашла уязвимость и там, получила доступ к коду авторизации некоторых сервисов и продолжила искать ответы. Этот инцидент без преуменьшения беспрецедентный, и я пока не могу представить, что должно произойти, чтобы политики, NSA, DOD и Китай не обратили на это внимание.

  • https://www.youtube.com/live/u8_Q7LNBmo4

  • 15 июл.15из adel_and_ml

    Насколько же сильно меняется работа, когда есть ИИ агенты. Мой коллега, биоинформатик, увидел статью, в которой хитрым образом находят специфичные гены в картошке. Понял, что это может быть полезно для нашего отдела по селекции клубники. Потому что и то, и другое распространяется вегетативно - то есть не через семена, а усы и клубни - они не родня, конечно, но в генетическом плане есть о чем поговорить, так сказать. Он дал эту статью агенту, который вооружен до зубов скиллами нашего собственного приготовления, и поставил задачу воспроизвести методы из статьи на наших данных клубники. Агент прочел работу, скачал с гита код, подтянул наши данные из бд, адаптировал что-то по мелочи, собрал контейнер, создал джобу на кластере и вот оно там бодро считается на нескольких Н100. По сути это задача интерна/джуна - “вот тебе статья, вот данные, через неделю покажешь, не надо плакать, все будет хорошо, соберись уже” Прогресс, как это часто бывает, выглядит немного несправедливо. И это, заметьте, не задачи кодинга, это по сути своей - applied research. Ведь агент не просто пишет код (если вообше пишет), а таскает за собой весь исследовательский контекст, внутреннюю кухню по данным и инфре. До сих пор не верится, что это все настолько хорошо работает. Ощущение, что оно где-то да вот вот зафейлится - но оно раз за разом хорошо отрабатывает. Магия 🤷‍♂️

  • 15 июл.8из aioftheday

    Claude на русском оказался самым строгим Anthropic изучил, как меняется поведение Claude в зависимости от модели и языка. Исследователи выделили четыре оси: уступчивость или осторожность, теплота или строгость, глубина или краткость, откровенность или ориентация на результат. На русском Claude сильнее всего склоняется к строгости. Он чаще оспаривает предположения пользователя, исправляет детали и требует доказательств. На хинди и арабском Claude заметно теплее, на английском осторожнее и подробнее, а на арабском еще и более уступчивый и краткий. Модели тоже отличаются. Sonnet 4.6 чаще поддерживает пользователя, шутит и отвечает коротко. Opus 4.7 чаще предупреждает о рисках, критикует идеи и подробно объясняет свою позицию. Anthropic пока не знает, откуда берутся различия. Возможные причины — объем и состав обучающих данных, культурные нормы и настройки моделей. В итоге получается, что одинаковый бизнес-план на русском и хинди Claude может оценить по-разному, даже если сам запрос не изменился. https://www.anthropic.com/research/claude-values-models-languages