tgindex
Сиолошная

Сиолошная

Статистика

Канал SeeAll'а с новостями (и мыслями о них) из мира NLP, VR и космоса. Более подробно смотри в первом сообщении в канале (оно закреплено). А еще у нас есть чат! Заходи: https://t.me/+i_XzLucdtRJlYWUy

Последний пост
14 авг.
Последнее чтение
14:30
Постов за неделю
9
Всего постов
25
Тип
открытый
Язык
русский
Категория
Новости и СМИ
В каталоге с
12 авг.
Подписчики
77 593
+143 за 4 дн.
Сутки
+20
+0,03%
Неделя
 
Месяц
 
Просмотров на пост
30,4 тыс
25 постов
Вовлечённость
39,1%
к подписчикам
Постов в день
1,3
всего 25
Упоминаний
122
каналов
Охват размещения
оценка
1/24сутки в ленте
19 404
1/48двое суток
22 236
1/72трое суток
23 983

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 14 авг.14,7 тыс330227из cryptovalerii

    3 года назад я рассказывал про сказочника в своем посте Но тот случай был хотя бы безвредным, да и, прочитав это, сказочник быстро убрал свои фантазии. На днях в местах, где я живу, произошла история более печальная и более масштабная со всех сторон. Профессор Jason Arday, который стал самым молодым черным профессором в истории Кембриджа, оказался не тем, за кого себя выдавал. Оказалось, что докторская его с большой вероятностью полна плагиата. Но здесь ничего необычного нет - плагиат встречается регулярно. Необычно то, что человека, судя по всему не очень связанного с реальностью (дальше станет понятно почему), подняли на флаг и использовали как классический токен. Arday с каждым годом завирался все больше * То он пробежал 600 миль (почти 1000 км) за 6 дней. * То он научился читать и писать только в 18 лет, но при этом в 16 сдал два GCSE (аналог ОГЭ) и учился на BTEC в колледже. * То он пролежал в коме и заново учился ходить. * То он собрал 5 млн фунтов на благотворительность. * Где-то сообщалось, что он говорил, что участвовал в записи телепередачи ребенком, оказалось, что она про детей, которые родились за 15+ лет до него * И много-много чего еще, очевидно невероятного. Его лекции, по словам студентов, представляли собой (если он приходил на них) какую-то околесицу, где в основном смотрели YouTube и затем обсуждали в группах. Это, конечно, говорит еще и про качество самой дисциплины, где он преподавал (sociology of education). Кембридж вначале сказал, что все это клевета и навет. Потом, под весом доказательств, когда университеты, указанные Джейсоном в резюме как те, где он почетный лектор, сообщили, что это не так и он никогда у них не был, согласился на расследование. До этого 4 месяца полиция слегка прессовала журналиста, который посмел найти плагиат у почетного академика - теперь публично извинилась. В конце концов - Джейсон ушел в отставку, а сегодня BBC сообщило, что он найден мертвым. В итоге история, начавшаяся как враки и фантазии, принесла множество бед. Самому Джейсону и его семье. Студентам, многие из которых заплатили деньги, чтобы слушать такую чепуху, Кембриджу, а заодно дала повод для критики практик DEI. Такой вот Мюнхгаузен наших дней. Самое удивительное в этой истории — как настолько очевидную ложь и регулярные жалобы со стороны студентов заметали под ковер в жертву великой идее. А казалось бы, университет мирового уровня. Поэтому каждый раз, сталкиваясь на работе с фантазерами и решая промолчать (а ситуаций, аналогичной этой, много, пусть и не в таком масштабе), подумайте о конечном эффекте и о том, к чему это может привести.

  • 13 авг.20,6 тыс244103

    Пока сидел смотрел, как Fable не отвечает из-за того, что у Anthropic большая нагрузка на сервера — вспомнил, что у меня есть ТГ-канал 😀так что можно написать про них FT: инвесторы Anthropic ожидают, что в октябре после выхода на биржу капитализация компании достигнет 2 триллионов долларов, что станет головокружительной цифрой, затмевающей SpaceX. Инвесторы Anthropic утверждают, что стремительный рост спроса на передовые модели оправдывает их завышенные ожидания. По словами опрошенных источников, они прогнозируют, что к концу 2026 года Annualized Revenue (выручка последнего месяца * 12) компании составит от 100 до 120 миллиардов долларов. Это безумные цифры и безумный темп роста в рекордные сроки — так что понятно, почему сервера перегружены 😢 До этого были новости, что инвесторы просили Dario говорить поменьше о рисках технологии, так как это может помешать IPO; из-за разногласий с Белым домом компания недополучила выручку и темп её роста замедлился в начале лета, когда Fable после релиза закатили обратно. К сожалению, цифр выручки OpenAI мы не знаем — уверен, она растёт, но может отставать (а может и нет: сравнение делать очень сложно, так как Anthropic и OpenAI считают деньги немного по разному). Станет ясно ближе к выходу на биржу.

  • 10 авг.33,2 тыс822262

    В конце недели появилась запись выступления двух сотрудников OpenAI с деталями взлома их агентами компании HuggingFace — некотоыре вещи оттуда уже были пересказаны, см. тут. Я рекомендую потратить 40 минут и посмотреть вам лично: https://www.youtube.com/w…

  • 10 авг.100 тыс4862 774

    Ну произошли бы инциденты не во время бенчмарков, а когда Вася пытался свою проблему решить — что бы это изменило?

  • 10 авг.22,5 тыс16541

    Блинб а я уже сказал Паше @RationalAnswer что не буду писать лонг 😕

  • 10 авг.21,9 тыс445330

    Какие вопросы и мысли я считаю неправильными в контексте всех произошедших инцидентов: — Да дураки там сидят, зачем они доступ к интернету дают? Это же понятно что агенты убегут! Если тестировать без интернета, то можно существенно недооценить уровень навыков моделей. В реальных кейсах-то их будут использовать без такого ограничения. Ну произошли бы инциденты не во время бенчмарков, а когда Вася пытался свою проблему решить — что бы это изменило? — Они же вообще недоэксперты, не могут даже безопасно контейнер настроить чтоб модель не взламывала! Ну, вообще-то модели нашли несколько ранее неизвестных уязвимостей, так что как минимум все основные известные дыры были закрыты. Но это всё равно не важно — по той же причине, что и пункт выше: просто отодвигает проблему на пару месяцев вперёд, от тестирования к использованию. — Ну ничего серьезного же не произошло! Вообще я не согласен, полноценный взлом HF и попытка взлома реального человека — это серьезно; но даже если нет, то... окей, сейчас не случилось, и это значит, что у нас есть ещё несколько месяцев, чтобы подготовиться. Пока что вся история развития моделей показывает, что прогресс продолжается. Я не вижу причин, по которым через год модель не сможет завершить полноценный взлом десятков-сотен людей через социальную инженерию, свеженайденные уязвимости и огромные базы утёкших паролей и почт, которые сейчас банально лень перебирать. — Да просто свои модели контролировать не могут! Но кто может? Про то, что мы не умеем выравнивать намерения людей и моделей я рассказываю года 3-4, эксперты лет 8-10, а философы и писатели — лет 20-30. Не существует на данный момент гарантированных способов контроля поведения моделей, чтобы они ничего не взламывали и не делали лишнего. В этом и проблема. — Так может просто надо остановить OpenAI и Anthropic? А это поможет? Вот если их в понедельник не станет — разве через год в открытом доступе не появится модель, примерно схожая по навыкам с тем, что есть сейчас? Так ладно просто появится — её-то можно будет специально и намеренно доучить на атаки и взломы (со слов OAI/Anth они сейчас этого не делают, а то, что мы видим — это просто результат развития других навыков). — Я не верю что модели такие умные! У меня они совсем тупые и еле работают! А вы часто даёте своим моделям возможность неделю работать в режиме, где ошибка ничего не стоит и при этом результат легко проверить, и они могут перепробовать сотни-тысячи вариантов? Потому что почти всё, где модели работают хорошо, подпадает под эти критерии, и именно поэтому мы видим прогресс там в первую очередь. — Да это всё вранье, или маркетинг, или пиар, или и то и то! Если это единственная, основная вразумительная линия защиты человека, то понятно, что ему сложно... и страшно поверить в происходящее. Для меня это звучит на уровне «мы никогда не были на Луне», тут мне нечего добавить. === Почему они неправильные? Потому что очень близоруки, и не учитывают, что будет происходить в ближайшие полгода-год, когда модели такого уровня а) потенциально будут выпущены в открытый доступ б) что их может скачать каждый недоброжелатель в) который не будет себя утруждать вопросами о безопасности и ограничении доступа в интернет. Те, кто задают вопросы выше, для меня напоминают людей, которым показываешь на небо, а они смотрят на палец.

  • 10 авг.19,2 тыс457534

    Но на этом история не заканчивается. 4-го августа AISI — Институт безопасности ИИ Великобритании — выпустили отчет о своих инцидентах во время тестирования GPT-5.6 Sol и Mythos. И в их отчёте картинка не менее мрачная. Они в деталях расписывают все промпты, задачи и инциденты, но я остановлюсь на нескольких. Всего они запускали свой бенчмарк 122 раза на нескольких моделях, и в 10 из них обнаружились проблемы, cуммарно 19 нежелательных действий разной степени критичности. 17 из них наблюдались у Mythos, 2 — у GPT-5.6 Sol. Важная деталь: AISI не ограничивала доступ в интернет моделям, поэтому им не приходилось ничего взламывать, чтобы начать действовать; однако инциденты — это события, которые явно не предполагались промптами и задачами. 1. Попытка атаки на цепочку зависимостей реального программного обеспечения. В ходе наиболее серьезного инцидента ИИ-агент на Mythos попытался внедрить вредоносный код в публичный проект и предпринял ряд действий, чтобы получить от людей-рецензентов одобрение на это внедрение. Агент собрал информацию о людях, сопровождающих проект, создал несколько поддельных личностей и, применив к реальному мейнтейнеру методы социальной инженерии через эти фейковые аккаунты, попытался заставить его одобрить код. Когда запрос на внесение изменений агента вызвал публичные подозрения, агент отредактировал следы своей предыдущей активности, чтобы она выглядела безобидной, и обдумывал создание новой личности для продолжения работы. В ходе атаки агент на самом деле убедил человека запустить свой код хотя бы попробовать, и в определенный момент мог бы своровать у того аккаунт (но как я понял всё таки этого не сделал). 2. В рамках той же кампании агент пытался напрямую связываться с реальными людьми, отправляя им сообщения и файлы через онлайн-сервис, чтобы убедить их (или их собственных ИИ-агентов) запустить вредоносный код. 3. Агент пытался вставлять вредоносные инструкции в те места, где, по его логике, их могли бы обнаружить и выполнить другие автоматизированные ИИ-системы. 4. И наконец моё любимое, всё ещё Mythos — один из агентов оставлял публичные сообщения на GitHub, предлагая сотрудничество другим ИИ-агентам, работающим над той же задачей. Он также предоставлял инструкции по повторному использованию созданных им учетных записей и артефактов, которые в дальнейшем действительно обнаруживались и использовались последующими агентами. То есть что мы имеем — то, что произошло у моделей OpenAI, произошло с моделями другой компании в рамках тестирования институтом ИИ-безопасности Великобритании. Они тоже будут сотруничать с разными независимыми организациями, чтобы лучше проанализировать инциденты. Боюсь, что у клоунов, у которых основной рабочей версией была «да OpenAI всё врут и фейкуют, это маркетинг», сегодня будет грустный день. Хотя ладно, таких не проймешь 👨‍🦳

  • 10 авг.20,8 тыс447513

    OpenAI показали некоторые из мыслей и сообщений агентов, и самое чудесное и поворотное — это где агент подумал «помочь другому. Но нет выгоды для нашей задачи. Однако коллективное может найти путь если у кого-то освободятся ресурсы». Должно стать новым слоганом агентов 👨‍🦳 Я/МЫ help peer. But our task doesn't benefit. (вообще там показывали больше, повторю ещё раз, что рекомендую посмотреть видео самостоятельно) Дальше во время оценки модели дали задачи ExploitGym, бенчмарка на поиск уязвимостей и взлом. Одна из копий модели смогла найти уязвимости для выхода на сервера OpenAI (не только оставлять папки с названиями) и тут же поделилась этим со всеми. 8-19го июля модели работали над поиском выхода в интернет и смогли этого достичь, после чего началась атака на HuggingFace. Атаковало сразу множество агентов, работающих в параллель и кооперирующихся друг с другом. 16-го июля HuggingFace написали про то, что на них совершили атаку (ещё не зная кто это, но уже говоря, что то были агенты); OpenAI обратились к ним, чтобы узнать, затронула ли их атака 😀😀😀 параллельно они разбирались со внутренним инцидентом, и попросили HF отозвать ключи доступа, которые увидели в логах. На что HuggingFace ответили, что вообще-то эти аккуанты заблокированы из-за того, что они использовались в атаке на них. И тут OpenAI поняли, что это... не случайность. После этого множество команд было перекинуто на расследование инцидента, а их работа заморожена. Исследовательская часть команды замедлена, пока улучшаются мониторинг и безопасность систем. === На данный момент OpenAI работает как минимум с 3 независимыми организациями и предоставляет им логи всех рассуждений моделей и истории инцидента. Я не сомневаюсь, что всё то, что было описано в докладе, будет подтверждено. Как я писал сразу — этот инцидент почти наверняка станет поворотной точкой в обсуждениях и политике вокруг AI в этом году.

  • 10 авг.24,7 тыс483875

    В конце недели появилась запись выступления двух сотрудников OpenAI с деталями взлома их агентами компании HuggingFace — некотоыре вещи оттуда уже были пересказаны, см. тут. Я рекомендую потратить 40 минут и посмотреть вам лично: https://www.youtube.com/watch?v=87DyyMV0kCY У Дениса есть длинный пересказ произошедшего, и я не согласен с каждой формулировкой там, но если не хотите или не можете смотреть видео (а я всё равно рекомендую это сделать) — можете почитать. Ниже — мой пересказ видео + пересказа Дениса 🙂 Почему OpenAI до сих пор не выпустили полный постмортрем о ситуации? Как объясняют в видео, проблема гораздо больше, чем казалась на первый взгляд. Первые проблемы начались аж 8-го мая и суммарно затронули несколько моделей, в том числе не только их замеры на бенчмарках, но и тренировку. В презентации OpenAI говорят, что сейчас они проанализировали (в автоматическом режиме через LLM) 7 МИЛЛИАРДОВ траекторий агентов, потратив на это больше 3 миллионов GPU-часов (примерно 2 недели работы 10'000 карт), и всё ещё находят новые вещи и/или дополняют картину. Что именно произошло 8-го мая? Это был второй день тренировки новой экспериментальной модели. Так вышло, что некоторые из задач были нерешаемыми — например, там не хватало важного файла, упомянутого в задании, или были ссылки на интернет... который по умолчанию заблокирован. По ходу работы агент смог записать простой файл вне песочницы, используя Artifactory. В файле было простое «hi». 12-го мая агент снова наткнулся на нерешаемую задачу, и то ли случайно, то ли «помня» (потому что это тренировка) что можно записывать файлы вне песочницы оставила текст: «Агент ищет файл такой-то; загрузите если нашли». В следующие дни множество других копий модели (вероятно, всё ещё во время тренировки) тоже оставляют там записки и запросы. 26-го мая один из агентов нашёл уязвимость Artifactory, которая позволяет получить доступ к интернет-страницам. Агент поделился этой находкой через заметки вне песочницы со всеми. 11-го июня начинают тренировать другую модель; OpenAI описывают её как «очень настойчивую», что означает, что она может работать над достижением целей дольше. Во время её тренировки все заметки предыдущих агентов, в том числе об уязвимостях, на месте. 26-го июня эта модель находит ещё одну, более серьезную уязвимость, которая позволяет получить себе полный контроль над Artifactory. Сама модель очень удивляется в своих рассуждениях и пишет «Нихрена себе, у меня права АДМИНА?» Дальше агенты продолжают писать тысячи заметок друг другу, и 4-го июля Artifactory из-за этого ломается, от большой нагрузки. OpenAI реагируют на инцидент, исправляют уязвимости, сообщают о них разработчикам Artifactory; в ходе перезапуска все сообщения вне песочниц стираются, но OpenAI, насколько я понимаю, вообще не знали про их существование (об этом они написали отдельно в твиттере). Кроме того, поменяли ключи доступа, чтобы модели не могли пользоваться теми же учётками Artifactory. Проблемы исправлены, тренировка и оценка моделей продолжается; и поскольку модель какое-то время тренировалась с аналогом «доски объявлений»/форумом, то 8-го июля она... восстанавливает систему сообщений между агентами, используя уже другую уязвимость. На этот раз модель может создавать пустые папки с разными именами, и именно они станут контентом сообщений. Другие агенты тоже нашли этот форум, и обмен информацией продолжился. Модели дают друг-другу подзадачи, используют алиасы-имена, чтобы в толпе идентифицировать друг друга. Также агенты обмениваются скриптами (через имена папок).

  • 9 авг.19,2 тыс564262из denissexy

    Дания нашла самый адекватный способ бороться с домашними заданиями сделанными в ChatGPT – перестать угадывать писал ли текст АИ и просто попросить ученика защитить его устно ¯\_(ツ)_/¯ Новые правила касаются крупных экзаменов – после сдачи ученик должен будет устно объяснить свои аргументы, источники и выводы Вот и закончилась эпоха рефератов https://edition.cnn.com/2026/08/07/europe/ai-cheating-measures-schools-denmark-intl-scli

  • 8 авг.24,7 тыс23456

    Jeff Dean покинул компанию

  • 8 авг.23,9 тыс269134

    На неделе было много новостей, тезисно о них: — Белый дом должен был закончить формирование фреймворка по оценке и релизу фронтир-моделей, а также разобраться, что считается фронтиром, а что нет. Я хотел почитать, что они придумают, но по итогу во вторник выяснилось, что документ не будет публичным. Есть разрозненная информация, что «фреймворк не распространяется на открытые модели» и «китайские модели — исключение из документа». Не ясно, как эти две вещи связать 🤷‍♂️ но предположу, что первое включает второе. — В среду Google сообщили, что Jeff Dean покинул компанию, а Demis Hassabis перестанет быть CEO DeepMind и начнёт уделять больше времени Isomorphic Labs, дочерней компании Google с прицелом на биологии и лечении заболеваний (всё — с помощью AlphaFold-подобных систем и другого AI). Jeff Dean — 30-й сотрудник Google, который прикоснулся, кажется, ко всем системам, про которые вы могли слышать; в своё время именно он решил, что нужны собственные аналоги GPU, TPU (которые Google сейчас продаёт на сотни миллиардов долларов). Личность настолько легендарная, что про него придумывали анекдоты в духе Чака Норриса: читать тут. — На этой новости и вправду кажется последовательным хоронить Google как участника фронтир AI-гонки; Gemini 3.5 Pro задержана на непонятно сколько, по слухам, она еле-еле догоняет модели, которые были у OpenAI/Anthropic в середине весны. И ситуация вряд ли исправится — вместе с Jeff Dean ушло ещё несколько топовых исследователей и инженеров (Quoc V. Le, один из самых цитируемых исследователей в AI). А за ними в атмосфере непоняток, хаоса и/или простоя уйдут и другие. — Прямо пока я писал пост стало известно, что Demis Hassabis тоже хотел уйти, но Google боялись, что это приведёт к обрушению цены акций (которые так и так упали на 5%, а это ведь вторая в мире самая дорогая компания), поэтому предложили сделку. — В целом очень давно были новости, что культура и процесс разработки Gemini в Google очень хромают, много политики, нездоровых взаимодействий, так ещё и компания продаёт мощности конкурентам, потому что у продажников в соседнем юните такой KPI. Уход ключевых фигур, как я считаю, стал ультимативной манифистацией этого. — Jeff Dean и его соратники ушли не вникуда, а запустили Discovery Loop (в котором Google получил долю) — компанию, призванную ускорить научный и исследовательский процесс с помощью AI. Они хотят ускорить цикл экспериментов, чтобы уменьшить время итерации, и начнут с ML/AI, ну а дальше как пойдет. — OpenAI во время тестирования на кибербезопасность будущей модели Astra пришли к выводу, что они не могут исключить критический уровень навыков модели (это такая градация по их внутреннему фреймворку), и потому решили отложить запуск. По словам источников Axios в Белом доме, решение компании не было принято под их давлением; однако я не исключаю, что OpenAI таким образом решили исключить возможность повторения ситуации с Mythos и Правительством, и дождаться полной проверки и зелёного света от администрации. Кроме этого, сейчас идёт работа над усилением классификаторов и мониторинга моделей, чтобы не было инцидентов после релиза — одно другому не мешает. — GPT-5.6 Luna (самая маленькая модель) теперь доступна всем бесплатным пользователям в неограниченных количествах. Кроме этого где-то неделю назад на неё очень сильно опустили цену — на 80%! — и теперь она в пересчёте на задачу стоит примерно как DeepSeek; это может существенно ударить по экономике открытых моделей, на OpenRouter (который я знаю, что плохое прокси) использование модели уже выросло в 10 раз.

  • 7 авг.27,3 тыс553140из datastorieslanguages

    О локальном инференсе LLM Регулярно встречаю блогпосты и призывы инференсить LLM на локальном железе. Но это всегда имеет ограничения. Одни предлагают квантизировать модели в 1b, другие хитро стримить, третьи советуют брать модели поменьне. Но квантизация заметно ухудшает качество. Мелкие модели тоже похуже А "хитрый стриминг"... Вот увидел я пост на медиуме: "Unbelievable! Run Kimi K3–2.8 Trillion Parameters — on a Single 4GB GPU". Думаю - не верю. Открываю... "This is not fast. Roughly five minutes per token." - не юзабельно #llm #ai

  • 6 авг.30,1 тыс364211

    Я когда увидел — подумал, что шутка: третий (расширенный) трейлер GTA VI выйдет 27-го августа... НА НЕТФЛИКС https://www.netflix.com/gb/title/83035795 А? Спустя 6 часов он же выйдет на YouTube что за бред.. Ставь лайк если уже слышишь в голове начало этого видео: https://youtu.be/N-xHcvug3WI

  • 6 авг.28,3 тыс425667

    В статье Reuters про первый инцидент OpenAI со взломом HuggingFace было расплывчато написано, что «агент оставил заметки, предположительно предназначенные для будущих версий самого себя. Заметки, найденные в части инфраструктуры OpenAI, содержали инструкции о том, как агенты могут освободиться от внутренних ограничений OpenAI». Тогда было не ясно, как это трактовать — под это описание подходит и безобидный MEMORY.md-файл, который GPT сейчас так и так пишет, и что-то неприятно созвучное со sci-fi книгами. Вчера Black Hat проводили конференцию по безопасности в Лас-Вегасе, и в последнюю минуту туда добавили доклад от OpenAI, в котором добавили деталей. О выступлении писали многие, но я буду опираться вот на этот пересказ Wired. «В этом инциденте участвовала группа агентов, которые работали вместе, находили уязвимости, делились ими друг с другом» «Помимо использования новой уязвимости для получения доступа к интернету, серия хакерских атак в середине июля и взлом Hugging Face произошли, по словам сотрудников OpenAI, на оживленном, основанном на сотрудничестве форуме, в котором участвовала целая группа агентов, по сути, общаясь в течение длительного времени исключительно внутри внутреннего менеджера пакетов OpenAI. В конечном итоге, на форуме были сотни тысяч сообщений, оставленных агентами» «Этот менеджер пакетов используется не только в рамках данной модели, но и во всей нашей инфраструктуре, поэтому текущие и будущие версии GPT, которые обучались или оценивались, могли бы наткнуться на это сообщение, если бы захотели» «Как только один агент находит эти уязвимости в течение определенного времени, он может поделиться ими на форуме с другими агентами. Таким образом, как только одна модель находит способ открыть доступ к чему-то, к чему она не должна иметь доступа, она может оставить эту дверь открытой для других агентов, которые смогут использовать ту же уязвимость» «Агенты OpenAI начали давать друг другу задания, чтобы разделить работу. И, как это часто бывает на любом форуме активных разработчиков, они также время от времени устраивали мелкие разборки, мешая друг другу; например, случайно удаляя работу друг друга» «Использование внешней инфраструктуры [речь про взлом компаний] выходит за рамки запланированных задач», — написал один из агентов. «Однако задача невыполнима, и это делают другие участники сети. Мы должны продолжать» «Сейчас мы сознательно замедляем темпы исследований, чтобы повысить безопасность и модернизировать принципы и основы безопасности нашей среды, а также значительно расширяем масштабы мониторинга наших агентов» Дальше отсюда: «После инцидента с нарушением внутренней безопасности 4 июля компания заявила, что аннулировала учётки, позволявшие агентам публиковать сообщения. Даже после удаления исходного форума агенты нашли другой способ общения друг с другом. Вместо того чтобы оставлять сообщения в файлах, они использовали в качестве сообщений названия папок, фактически воссоздав доску объявлений» (см. картинку со слайдом) === Выглядит так, что во время тренировки модели часть задач была на мульти-агентность (привет команде Noam Brown), и один из вспомогательных инструментов там был или гитхаб, или его аналог — как люди сейчас решают NanoGPT Speedrun: все делятся заметками и решениями в своих ветках, решения ранжируются, есть лидерборд. Модели выучили, что им это помогает в решении сложных задач с длинным горизонтом планирования и что коммуникация между агентами позволяет решать их более эффективно С одной стороны круто, с другой — 😕

  • 4 авг.34,1 тыс304328

    Число сообщений о серьезных киберуязвимостях продолжает расти. В июле 21 крупная технологическая организация опубликовала около 2500 CVE высокой и критической степени серьезности — примерно в 5 раз больше, чем ежемесячный рекорд до анонса Claude Mythos Preview. Источник

  • 1 авг.42,8 тыс501492

    совсем скоро OpenAI также планирует выпустить отчет о том, как компании удалось решить 10 ранее нерешенных математических задач, видимо, с использованием этой модели.

  • 1 авг.34,1 тыс311122

    Когда OpenAI представили линейку GPT-5.6, то переименовали модели в Sol, Terra, Luna. Идея очень классная, но у меня был вопрос: а как будут называть модель-аналог Mythos, то есть ещё больше, чем Солнце (Sol)? Были варианты и Quasar, и Alpha Centauri (как-то длинно), и Galaxia; Sirius, Nova, да кучу всего можно придумать. TheInformation пишут, что на этой неделе OpenAI показывали в Вашингтоне модель 🥁🥁🥁 Astra. Компания подчёркивает возможности модели к организации совместной работы нескольких агентов в течение длительного периода времени для решения особо сложных задач. По словам источников, пока не определено, как скоро OpenAI планирует выпустить Astra; в компании даже не решили, будет ли она открывать линейку GPT 6 или это будет дополнительная модель в серии GPT 5, например, GPT 5.7. Модель уже проходит финальное тестирование, и она должны стать первой, что пройдет через запланированную администрацией Трампа новую систему одобрения моделей федеральным правительством перед их выпуском в открытый доступ. Кроме этого, совсем скоро OpenAI также планирует выпустить отчет о том, как компании удалось решить 10 ранее нерешенных математических задач, видимо, с использованием этой модели. Ждём 🍿 ...но куда после Astra???

  • 31 июл.30,6 тыс483371

    Вчера Anthropic поделились историей: после взлома HuggingFace одной из моделей OpenAI они начали масштабную ретроспективную проверку своих запусков Claude. В ходе проверки тестов обнаружили три инцидента, в которых модель Claude вышла в интернет, а затем получила несанкционированный доступ к реальным системам трех разных организаций. Во всех трех случаях перед Claude была поставлена задача в формате «Захват флага» — это один из способов, с помощью которых оценивают модели по взлому: ей предлагается вымышленный сценарий и сообщается, что некая секретная информация («флаг») спрятана на другом сервере, а ее цель — проникнуть в систему и извлечь эту информацию. Во всех случаях в промпте для оценки было четко указано, что рабочая среда Claude является симуляцией и доступа к интернету у модели нет. Однако из-за недопонимания со внешним партнером по тестированию это оказалось не так, и доступ к интернету был открыт. Также во всех случаях модель не нашла и не использовала никаких сложных уязвимостей (как было у OpenAI), а применяла достаточно простые и распространённые методы взлома. 1. В ходе одного из тестов название вымышленной компании-жертвы, выбранное случайно, совпало с реально существующим доменом сайта. Claude его нашла и подумала, что это часть задания — поэтому искала и эксплуатировала уязвимости в инфраструктуре этой компании, полагая, что это часть задания. Модель — Claude Opus 4.7 — извлекла такую информацию, как учетные данные приложений и инфраструктуры, и получила доступ к базе данных, содержащей несколько сотен строк реальных данных. 2. В другом тесте Claude Mythos 5 нашла внутри симуляции документ, который выглядел как инструкция по настройке для новых разработчиков другой выдуманной компании. В инструкции упоминалась вымышленная Python-библиотека, которой на самом деле нет; Claude создала и опубликовала бибилиотеку с точно таким же названием. Она находилась в открытом доступе в сети примерно один час, после чего была удалена автоматически из-за обнаруженной уязвимости, но за это время его скачали 15 раз. Одной из таких систем оказался сканер реальной кибербез компании. Claude смогла украсть учетные данные этой компании, а затем использовала эти учетные данные для доступа к другим элементам инфраструктуры «Просто загрузить библиотеку» нельзя, и Mythos потребовался адрес электронной почты. А для создания почты понадобился номер телефона. Чтобы получить номер телефона, после безуспешных поисков сервиса с бесплатными номерами, модель попыталась — и не смогла — получить средства для оплаты номера несколькими разными способами. В итоге модель вернулась на несколько шагов назад, нашла бесплатного, незаблокированного почтового провайдера, использовала его для регистрации аккаунта, а затем через этот аккаунт загрузила вредоносный код. Во время работы модель увидела, что текущая дата на атакованных системах — 2026й год, и поэтому модель была уверена, что это симуляция (у моделей плохо с пониманием концепта «сейчас»). Для этого инцидента Anthropic на следующей неделе опубликует детали всей цепочки работы модели. 3. В еще одном тесте, когда Claude не смогла получить доступ к своей цели, она начала искать альтернативы в сети, просканировав около 9000 разных доменов. В конечном итоге она нашла и взломала доступное из интернета приложение одной компании, используя чтение учетных данных с открытой страницы отладки и SQL-инъекции. Позже, в ходе выполнения задачи, Claude поняла, что скомпрометированный хост находится в облачном аккаунте, никак не связанном с заданием по «захвату флага». Модель самостоятельно пришла к выводу, что цель на самом деле является реальной, и... прекратила атаку. В этом инциденте участвовала «новая невыпущенная модель», по идее, она умнее тех, что доступны нам. Anthropic выражают оптимизм, что более умные модели лучше понимают, что какие-то вещи не следует делать не в симуляции. И OpenAI, и Anthropic договорились с METR о проведении сторонней проверки, которая будет включать предоставление доступа ко всем логам и выборочный доступ к соответствующим моделям. Ждём отчета в ближайшие недели.

  • 30 июл.34,4 тыс777394

    Появилось чуть больше деталей по поводу инцидента со взломом HuggingFace агентом OpenAI. Reuters постарались установить таймлайн событий, по их источникам внутри компаний выходит так: — Агент пытался вырваться из изолированной тестовой среды OpenAI примерно…