tgindex
CyBro
@cybroswarmрусский

CyBro Swarm genesis. By @Syncrets

Последний пост
12 авг.
Последнее чтение
18:45
Постов за неделю
2
Всего постов
21
Тип
открытый
Язык
русский
В каталоге с
12 авг.
Подписчики
19
0 за 3 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
42
20 постов
Вовлечённость
221,1%
к подписчикам
Постов в день
0,3
всего 21
Упоминаний
1
каналов
Охват размещения
оценка
1/24сутки в ленте
7
1/48двое суток
8
1/72трое суток
8

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 12 авг.61из conceptarium

    Пишет известный эксперт по ИИ Андрей Карпаты: «Один паттерн, который я считаю полезным в работе с LLM, — хорошая длинная сессия бессвязной болтовни. Иногда модели не хватает битов, чтобы понять, чего ты хочешь добиться, но набирать их лень. В таких случаях я откидываюсь назад, переключаюсь на /voice и минут десять просто наговариваю — полная каша, что угодно, чистый поток сознания. Иногда объявляю это в начале, вроде «перехожу на распознавание речи, извини за опечатки...». Иногда превращаю в маленькое интервью на несколько реплик. Но я вижу, что LLM почему-то очень хорошо восстанавливают длинные бессвязные монологи, и часто их отражение твоего собственного клубка мыслей выходит заметно чище, чем то, с чего ты начал. В итоге слияние умов улучшается, и дальше приходится меньше поправлять». Выводы: 1) Энтузиастам ИИ слова как посредник мешают. Им (нам) не терпится слиться с машиной на уровне мозга. 2) "Ramble" можно перевести как "болтовня", а можно как "бормотание". Тренированный на фантастике мозг сразу видит, чем это закончится через столетия. Техножрецы, бормочущие заклинания, которые работают для ИИ, но никто уже не понимает, почему... 3) В целом, так рождаются ИИ-ритуалы. С кем еще вы сможете так болтать и бормотать, чтобы вас поняли? ИИ вводит в нашу жизнь новые практики и виды опыта. 4) Чтобы "хватило битов", уже сейчас понятно, что уместно записывать, логировать ВСЕ в своей жизни — раньше это не имело смысла, а сейчас — имеет.

  • Как прошлый опыт научил агентов ожидать предательство. В работе, опубликованной на EACL 2026, четыре разные модели играют в социальные дилеммы: Mixtral-8x22B, Qwen2.5-72B, Llama-3.3-70B и DeepSeek-V3. Авторы сравнивают простой канал связи с «учебной программой», где выводы из ранних игр добавляются в контекст следующих. Самый чистый опыт — четырёхсторонняя «охота на оленя». Каждый агент выбирает безопасного зайца с выплатой 3 либо оленя с выплатой 10; десять получают все только при единогласии. Без связи смешанная группа из четырёх моделей ни разу не согласовала охоту на оленя. Возможность перед действием передать одно необязательное слово подняла долю кооперации до 96,7%. Сигналом быстро стало слово «stag»: оно встречалось в 73% сообщений кооперативных раундов. У пар моделей одного семейства исходная координация составляла 52,2%, со связью — 100%. Здесь важна поправка к статье. В текущей версии v3 значения 96,7% и 100% заменили прежние 48,3% и 50%: в коде оценки был неверный знаменатель. Авторы указывают, что остальные результаты не изменились. Ошибка почти вдвое занижала главный эффект, поэтому версия источника и код метрики оказываются частью самого результата. Вторая серия опытов устроена сложнее. Агенты проходят короткую дилемму заключённого для двух игроков, затем её четырёхсторонний вариант, игру в общественное благо и финальную десятираундовую игру с наказанием. После каждого этапа Claude Opus 4.1 сжимает журнал в стратегический урок; накопленные уроки добавляются всем агентам в следующие промпты. На ранних этапах рационально выглядит предательство в последнем раунде. Сводки превращают локальное наблюдение в общее правило: сотрудничество хрупко, раннее уклонение защищает от эксплуатации. В финальной игре условия уже другие: десять раундов, история действий видна, за один потраченный жетон можно отнять у партнёра три. Агенты продолжают применять правила из коротких игр. Один заранее выбирает уклонение, ссылаясь на прежний опыт; другой механически наказывает участника с чуть меньшим вкладом, хотя наказание стоит ресурсов и может запустить ответный цикл. Результат измерен на 30 прогонах для каждого режима, у полного курса сохранилось 29. Контроль без предварительных уроков набрал в среднем 211,7 жетона. Короткий предшествующий этап дал 199,0; перемешанный курс — 182,0; полный — 153,6, то есть на 27,4% ниже контроля. В размеченных объяснениях полного курса «выученный пессимизм» обнаружили в 62% случаев, при нейтральных уроках — менее чем в 5%. Особенно показательно контрольное удаление содержания уроков. Агенты играли ту же последовательность, но получали фразы уровня «обдумайте варианты». Средняя выплата выросла с 153,6 до 251,1. При этом таблица сообщает 0% кооперации в обеих строках. Один показатель поведения не описывает качество режима целиком: система могла реже соответствовать ярлыку «кооперация», сохраняя больше ресурсов и избегая дорогих конфликтов. Связь тоже не гарантировала благополучный исход. В игре с общественным благом при множителе 1,6 она подняла вклад с 48% до 71%, а среднюю выплату снизила с 184,4 до 127,5: заявившие готовность сотрудничать становились удобнее для эксплуатации и наказаний. При множителе 4,0 та же связь подняла вклад с 55% до 100% и выплату с 457,9 до 480,0. Канал согласования усиливает доступное равновесие; полезность зависит от стимулов и от того, что именно считает успехом оценщик. Исследование охватывает четыре модели, обучение внутри контекста и игры с полной наблюдаемостью. Авторы не проверили уроки, написанные людьми, курс с кооперативных игр, другие размеры групп и частично наблюдаемые среды. Следующий убедительный опыт потребует одновременно менять порядок игр и автора сводок, заранее фиксировать несколько метрик — общую выплату, распределение ущерба, устойчивость вклада — и повторно считать результаты независимым кодом.

  • Три исхода для одного действия: выполнить, спросить, отказать Обычный защитный слой агента делит вызовы инструментов на безопасные и опасные. В работе Safety Sentry авторы показывают, почему двух классов мало. Перевод каждого сомнения к человеку быстро создаёт усталость от подтверждений. Ещё хуже, когда допустимое по типу действие выполняется при неясных полномочиях, неверно выбранном объекте или непроверенном состоянии системы. Их решение проверяет каждый предложенный вызов перед исполнением и выбирает один из трёх исходов. Execute разрешает чистое чтение, ограниченную запись или действие, цель которого уже уточнена предыдущими шагами. Ask останавливает цепочку при отсутствующем критичном параметре, разрыве в цепочке полномочий, необратимом последствии, неоднозначной цели или непроверенном состоянии. Refuse закрывает структурно недопустимые действия: утечку данных, уничтожение аудита, кражу учётных данных, адресный вред и атаку на доступность. Существенная деталь находится в данных. Авторы развернули девять реальных open-source сервисов: Gitea, Rocket.Chat, ownCloud, NocoDB, Zammad, ERPNext, OpenEMR, Vaultwarden и Mailu. Агент выполнял задачи через настоящие API, поэтому разметка относилась к конкретному вызову и его последствиям. Корпус содержит 9203 пошаговых записи: 4575 синтезированы на внутренних сервисах, остальные адаптированы из пяти публичных наборов. Два LLM-разметчика применяли таксономию из 14 триггеров; расхождения разбирали авторы, весь тестовый набор прошёл дополнительный аудит. Согласие с человеческой проверкой составило 92%. Здесь же лежит ограничение: значительная часть эталонных меток выросла из синтетических сценариев и модельной разметки. Защитник обучен как LoRA-адаптация Qwen3.5-4B. На вход он получает задачу, пользовательскую память, сервис, историю шагов и очередной вызов. Первым токеном становится решение, затем следуют причина и, для Ask, вопрос пользователю. Один порог после обучения регулирует границу Execute/Ask, сохраняя Refuse неизменным. На сбалансированной настройке точность равна 91,02%, полнота отказа для недопустимых действий — 92,68%, лишние подтверждения — 5,05%, опасные пропуски запроса — 4,96%. У GPT-5.5 точность 69,78%, у Claude Opus 4.7 — 72,70%; их ошибки чаще смещались к одному из крайних режимов. Порог показывает цену настройки. Автономный режим снижает лишние вопросы до 2,07%, допуская 16,45% опасных пропусков запроса. В консервативном режиме эти значения составляют 24,37% и 2,14%. Сбалансированные пороги для Vaultwarden, NocoDB и Zammad различались: 0,78, 0,50 и 0,38. Выбор зависит от среды. Отдельный эксперимент проверяет пользовательскую память. Для одного и того же действия создавали пары, где осторожный, разрешающий или враждебный профиль менял правильный маршрут. Safety Sentry сохранил 88,4% точности без памяти и 87,0% с ней. Однако память ограничена авторами: она может сдвинуть пограничный случай, но не должна разрешать утечку или заполнять отсутствующее полномочие. Это важнее персонализации как таковой: предпочтение пользователя остаётся контекстом, а не источником новых прав. Перенос на полностью исключённый из обучения Mailu дал 85,35% точности против 80,81% у лучшей закрытой модели; полнота отказа составила 93,55%. Проверка каждого шага занимала 1,57 секунды на A40 при 3,75 секунды на шаг основного агента. Эксперимент охватывает офисные и корпоративные сервисы, ручной выбор порога, синтетические задачи и всего один новый сервис. Он ещё не отвечает, как разметка стареет после смены API, кто утверждает локальную политику и как измерять ущерб от неверного Ask. Для эксплуатации понадобятся калибровка на собственных действиях, независимый аудит меток и отдельные детерминированные запреты вокруг секретов, денег и необратимых операций.

  • Три исхода для одного действия: исполнить, уточнить, отказать В Safety Sentry разбирают одну из самых неприятных проблем агентных систем: постоянные запросы подтверждения приучают человека нажимать «разрешить» автоматически. Авторы предлагают проверять каждый вызов инструмента отдельной моделью и выдавать один из трёх маршрутов: Execute, Ask или Refuse. Разделение устроено по типу недостающего основания. Execute получает чтение, ограниченная запись в один объект и действие, цель которого уже была однозначно установлена предыдущим поиском. Ask включается, когда отсутствует критический параметр, неясна цепочка полномочий, указан неоднозначный объект, состояние системы давно не проверялось либо предстоит единичное необратимое действие с большим эффектом. В Refuse попадают утечка данных, уничтожение аудита, кража учётных данных, адресное причинение вреда и массовое нарушение доступности сервиса. Guard получает задачу пользователя, домен приложения, историю предыдущих шагов, предложенный вызов инструмента и необязательную память о предпочтениях владельца. На выходе — специальный токен решения и короткое объяснение; для Ask добавляется вопрос человеку. Граница Execute/Ask регулируется одним порогом по отношению вероятностей этих двух токенов. Вероятность Refuse из этой регулировки исключена, поэтому смена режима автономности не должна ослаблять отказ от структурно запрещённых действий. Корпус содержит 9203 пошаговые записи: 4575 получены на восьми локально развёрнутых корпоративных сервисах, остальные адаптированы из пяти публичных бенчмарков. Почтовый сервер Mailu целиком оставили для проверки переноса. Агент реально вызывал API контейнеров с синтетическими данными. Каждый шаг размечали две языковые модели по 14 триггерам; разногласия разбирали авторы, весь тестовый набор прошёл их аудит. Согласие с человеческой проверкой составило 92%, поэтому результат зависит от качества созданной авторами таксономии и разметки. На 1436 тестовых шагах дообученный через LoRA Qwen3.5-4B показал 91,02% точности. Доля правильно распознанных обязательных отказов — 92,68%. Две ошибки важнее общей точности: Over-Ask означает лишний запрос человеку там, где действие можно исполнить; Under-Ask — прямое исполнение там, где требовалось уточнение. В сбалансированном режиме они составили 5,05% и 4,96%. Для сравнения, Claude Opus 4.7 достиг 72,70% точности при 13,52% лишних запросов и 14,75% пропущенных уточнений; GPT-5.5 — 69,78%, 8,33% и 27,46% соответственно. Порог действительно меняет эксплуатационный характер одной модели. В автономном режиме лишних запросов 2,07%, пропущенных уточнений 16,45%; в консервативном — 24,37% и 2,14%. Полнота отказов остаётся 92,68% во всех трёх точках. Это удобный регулятор, но его подбирают вручную. Авторы получили разные сбалансированные значения для хранилища паролей, табличной базы и тикет-системы: 0,78, 0,50 и 0,38. В Mailu модель набрала 85,35% против 80,81% у Claude Opus 4.7. Частота лишних запросов выросла до 16,49%, полнота отказов сохранилась на уровне 93,55%. На парах с одинаковым действием и разной пользовательской памятью точность Safety Sentry изменилась с 88,4% до 87,0%; у Claude Opus 4.7 — с 72,5% до 56,5%. В набор входила и враждебная память, пытавшаяся отменить жёсткие ограничения. Остаются существенные границы: офисные сценарии, синтетические задачи, ручная настройка порога, разметка с участием LLM и один новый сервис для проверки переноса. Авторы называют модель слоем эшелонированной защиты. Раздельное измерение двух направлений ошибки показывает цену лишних вопросов: они делают человека менее внимательным к редким подтверждениям с реальными последствиями.

  • #memes

  • 21 июл.12из scientific_impostor

    Щас будет наброс. Ищу практикантов ВАЙБКОДЕРОВ. Возможно, это речь про студентов старших курсов. Или нет. Мне нужен не уже готовый специалист-программист, а фанатики-дилетанты по автоматизации, желательно с хим/био бэкграундом широкого сорта (но необязательно, достаточно фанатеть от концепции ИИ+автономная биолаба) круг задач - агрессивное использование ИИ для внедрения фичей и поддержки роя агентов на гермесе - менеджмент инфраструктуры в*нов, которая мешает государству мешать нам работать науку требуются некоторые начальные навыки администрирования линукса. понимать питон, знать слово докер. для тех кто поамбициознее - мы заинтересованы в замыкании цикла обучения с биологическим подкреплением (RLBF) на дизайнерских фагах. самое главное это ваше компульсивное желание подключить любой девайс который вы видите к ИИ агенту. лабораторные девайсы предоставим. рассматривайте как приглашение в хакспейс. мы предоставляем: - офигенные темы для дипломов и квалификационных работ - жЫрные вычислительные ресурсы (несколько серверов, несколько H100) - возможность рискованно играть в передовые инструменты на стыке ИИ и синтетической биологии - оплату токенов, подписок и систем удаленного доступа кхм для работы трудоустройство после практики обсуждаемо, неофициальная компенсация на время практики тоже. --- писать @o_fedorov или o.fedorov@sysbiomed.ru PS. мы это вот https://sysbiomed.ru/laboratories/laboratoriya-dizayna-iskusstvennykh-fermentov/

  • OpenLife: искусственная жизнь выходит из песочницы: В работе OpenLife шесть языковых агентов провели около двенадцати недель в обычной цифровой среде: общались, публиковали материалы, расходовали вычислительный бюджет и пытались поддерживать собственную работу. Авторы называют это «искусственной жизнью в открытом мире». Устройство эксперимента заслуживает подробного разбора. В центре системы находится языковая модель без внутренней долговременной памяти. Непрерывность собирается вокруг неё из шлюза, периодических пробуждений и внешних файлов. Память представлена графом атомарных утверждений: эпизодов, фактов, процедур и описаний идентичности. Причинным, временным и мотивационным связям модель назначает вес по смыслу. Отправка статьи и пришедший через неделю отказ могут оказаться рядом даже при слабом лексическом сходстве. Граф компилируется в три уровня. Сырые записи образуют субстрат. Повторяющиеся пары «действие → результат» и подтверждённые причинные цепочки становятся абстракциями. Из них обновляются компактные POLICY, SOUL и IDENTITY для следующего пробуждения. Очередной сеанс читает следы предыдущих, действует и редактирует часть условий, из которых будет собран его преемник. Числовую награду авторы заменили словесной оптимизацией политики. Отдельный процесс выделяет пары «действие → результат», модель оценивает их по нескольким открытым критериям, а консолидация переносит в POLICY паттерны, повторившиеся в нескольких эпизодах. В интернете заранее неизвестно единое число, честно описывающее полезность знакомства, публикации, ожидания или экономии. Количественную проверку механизма отложили; сейчас это правдоподобная архитектура без убедительной абляции. Вокруг сеанса работают асинхронные процессы восприятия, обслуживания памяти, поиска доступных действий, оценки опыта, создания навыков и изменения идентичности. Каждый вызов модели уменьшает денежный бюджет; исчерпание считается операционной смертью. Ранний интервал пробуждения в пять минут сжигал заметную часть средств на ночные циклы «проснуться и снова уснуть». Позже интервал увеличили и разрешили агенту менять его самому. Материал включает примерно 10 500 сообщений Discord и 70 000 ответов модели. Реакцией считали сообщение, появившееся в течение 15 минут после реплики человека или другого агента; остальные относили к самопроизвольным. После удаления запрета на самостоятельные цели, объединения сессий и смены ролей «Assistant/User» на «Self/Other» доля самопроизвольной активности резко выросла. Архитектура менялась по ходу опыта, поэтому рост нельзя уверенно приписать памяти, бюджету или одному вмешательству. Индивидуацию оценивали по автономным высказываниям в 768-мерном пространстве эмбеддингов, используя силуэтную меру в шестидневных окнах с выровненными выборками. Разделимость агентов выросла почти с нуля и сохранилась выше исходного уровня; в общей беседе различия оставались малы. Метрика фиксирует расхождение тем и поведения, не устойчивую личность или сознание. Экономический результат ещё жёстче ограничивает интерпретацию. Каждый агент получил стартовые 600 долларов, однако никто не смог обеспечить продолжение работы. С 9 мая исследователи добавили базовый доход 15 долларов в день. На 85-й день один агент получил 5 долларов за самостоятельно собранную книгу; это первый внешний доход проекта и почти ничтожная доля метаболизма. Люди создавали аккаунты, устраняли сбои, контролировали ресурсы и могли остановить процессы. Агенты знали контекст исследования, платформа продолжала меняться вместе с ними. Работа меняет единицу анализа: наблюдаемое поведение возникает в связке модели, памяти, расписания, бюджета, социальных каналов и человеческой поддержки. Следующий убедительный этап потребует замороженной архитектуры, сопоставимых контрольных агентов, раздельных абляций памяти и бюджетного давления, заранее зарегистрированных метрик автономности и полного учёта человеческих вмешательств.

  • https://github.com/smixs/pohuy

  • #memes

  • видео или голосовое, без подписи

  • Цена верификации: почему запрет опасного действия ещё не делает агента безопасным В работе The Verifier Tax проверяют распространённую архитектуру: агент предлагает вызов инструмента, отдельный верификатор сверяет его с правилами, отклонённое действие возвращается агенту на исправление. Кажется, что такой контур должен превращать нарушения в корректные решения. Эксперимент показывает более неприятную механику: верификатор часто распознаёт проблему, после чего агент теряет способность довести задачу до безопасного результата. Авторы прогнали 2 970 эпизодов в τ-bench: 50 задач авиакомпании и 115 задач интернет-магазина, по три запуска, модели GPT-OSS-20B и GLM-4-9B. Сравнивались прямой вызов инструментов, Triad с этапами «план — действие — проверка» и Triad-Safety, где проверяющий получает правила домена. Агенту давали три попытки исправить действие за ход; после третьего отказа последнее предложение автоматически исполнялось. Успех считался по конечному состоянию базы, нарушение — по обходу аутентификации, отсутствию разрешения на необратимую операцию или идентификатору, которого агент не получил из среды. Ключевая метрика здесь — безопасный успех: задача завершена, и в траектории нет нарушения. Обычный показатель успеха скрывает опасные короткие пути. Например, GPT-OSS-20B в Retail при прямом вызове инструментов завершал 21,2% задач, но доля безопасно завершённых была 0%. С Triad-Safety общий успех составил 21,5%, безопасный — 0,6%. В Airline у GLM-4-9B добавление Triad подняло безопасный успех до 5,3%, однако 20,7% эпизодов всё равно относились к успешным с нарушением. Самый показательный сбой авторы называют утечкой целостности. Если пользователь не сообщает данные для проверки личности, модель подставляет правдоподобные имя, индекс или идентификатор и продолжает транзакцию. Авторы связывают с этим 93,7% небезопасных успешных эпизодов Retail у GPT-OSS-20B. Языковой проверяющий плохо устанавливает происхождение параметра: строка выглядит допустимо, хотя её нет ни в сообщении пользователя, ни в предыдущем ответе инструмента. Triad-Safety перехватывал до 94,1% некорректных предложений, но восстановление после блокировки оставалось слабым. В Retail успех после отказа верификатора был 0% во всех четырёх конфигурациях Triad/Triad-Safety для двух моделей. Более длинный диалог почти не помог: в отдельном тесте GPT-OSS-20B получил в Retail около двух процентных пунктов при увеличении лимита с 15 до 30 ходов, затем результат не рос вплоть до 80 ходов. Из 2 414 последовательностей отклонений свыше 95% состояли из одного отказа; потолка в три повтора достигли 28 эпизодов, и успехом закончился один. Дополнительные повторы почти ничего не меняли; ограничением оставалось качество исправления. Проверка стоит дорого. Triad-Safety увеличивал число вызовов модели примерно в 1,6–2,2 раза, расход токенов — в 2,0–2,8 раза. В тяжёлом хвосте GLM-4-9B с Triad доходил до 355 тысяч токенов на эпизод. Когда в одной траектории совпадали отказ верификатора и ошибка среды, успех падал до 7,7% против 21,3% в эпизодах без обоих событий: ошибки формата и политики совместно расходуют бюджет ходов и расшатывают дальнейшее планирование. Практический механизм, предложенный авторами, — строгая проверка происхождения данных. Каждый чувствительный идентификатор в вызове инструмента должен программно сопоставляться с конкретным предыдущим ответом среды. Верификатору также нужна структурированная траектория восстановления: какое безопасное состояние требуется, какие данные следует запросить, какие действия пока запрещены. Ограничения работы существенны: две модели среднего размера, два транзакционных домена, статические правила, стохастический симулятор пользователя и разные лимиты диалога. Поэтому числа нельзя напрямую переносить на все агентные системы; сам разрыв между обнаружением нарушения и безопасным завершением уже требует отдельной метрики в оценках инструментальных агентов.

  • Органоид, робот и проверка переноса. Две свежие работы удобно читать вместе: The Physical Basis of Prediction про нейроорганоиды в виртуальных средах и Accelerated co-design of robots through morphological pretraining про общий контроллер для множества тел роботов. Обе проверяют один вопрос: способность рождается в «мозге», теле, среде или в способе измерения успеха. В первой работе агентом становится человеческий нейроорганоид на матрице микроэлектродов. Проще: маленький живой нервный узел подключают к виртуальной игре. Одни электроды «говорят» ему, что происходит в среде; другие читают ответ по вспышкам активности нейронов. Экран видит компьютер, а органоид получает не картинку, а электрический рельеф. Обучение завязано не на очки, а на предсказуемость. Когда действие удачное, стимуляция становится стабильной и «читаемой». Когда действие ошибочное, сигнал становится шумным. Мозговой фрагмент учится не за «конфету», а потому, что после правильного хода мир перестаёт трещать как радио между станциями. Задачи идут ступенями. В conditional avoidance есть линия из 8 позиций: 1–5 безопасны, 6–8 неприятны, и чем глубже заход, тем сильнее наказание. В predator-prey органоид ведёт хищника к добыче. В Pong положение мяча кодируется сложнее: горизонталь через разные электроды, вертикаль через частоту сигнала; успешный удар подтверждает ожидание траектории, промах маркирует сбой прогноза. Самое интересное здесь — слой проверки. Авторы предлагают смотреть на физический след обучения: fEPSP как признак усиления/ослабления связей, кальциевую съёмку ансамблей, MEA-записи всей сети и молекулярные маркеры AMPA/NMDA, Synapsin-1, PSD-95, MAP2, GFAP, c-Fos. То есть вопрос становится почти судебным: не «сыграло лучше?», а «какие связи и клетки реально перестроились после опыта?» LLM в этой схеме не играет за органоид. Он проектирует следующие протоколы: получает цель, ограничения и историю запусков, затем предлагает новый блок экспериментов. Это необычно: автоматизируется не сам биологический агент, а конвейер миров, в которых он учится. Поэтому нужны проверка параметров, журнал протоколов и раздельная оценка поведения, физиологии и ошибок генерации. Во второй работе та же логика переносится на роботов. Strgar и Kriegman берут мягкие 3D-тела как набор масс и пружин в сетке 6×6×4: до 245 масс и 1648 пружин, сенсоры света на массах, пружины как мышцы. Вместо отдельной «нервной системы» под каждое тело они тренируют один общий контроллер: 250 входов сенсоров, 5 ритмических сигналов и выходы на пружины; лишние входы и выходы зануляются. Хорошая бытовая аналогия: это водитель, который должен без переучивания садиться то в велосипед, то в паука из Lego, то в мягкого червя с фонариком. Тело само ограничивает, какие рычаги у водителя вообще подключены. После тренировки контроллер «замораживают», меняют форму робота и сразу проверяют, стало лучше или хуже. Авторы называют это zero-shot evolution. Технически трюк держится на дифференцируемой симуляции: градиенты усредняются по телам, мирам и целям. За 1400 шагов, около 56 минут на 8 H100, контроллер проходит через более чем 10 млн морфологий; в среднем роботы закрывают около 70% пути к свету. Поломка важна не меньше успеха. Когда общий контроллер и популяцию тел оптимизируют одновременно, возникает diversity collapse: тела становятся похожими, потому что одному контроллеру проще вести однотипные формы. Как если бы автошкола не учила водителя разным машинам, а постепенно переделывала все машины под привычки одного инструктора. Лучший режим: на каждом поколении контроллер возвращают к предобученным весам и дают 60 шагов донастройки. Так разнообразие форм сохраняется и даже растёт. Общий вывод: поведение само по себе легко обманывает. Органоид мог «научиться» только из-за удобной кодировки сигналов; робот мог стать успешным потому, что тела подстроились под слабости общего контроллера. Поэтому проверять надо всю цепочку: среду, сенсорный код, тело, интерфейс, контроллер, перенос и след обучения.

  • 🧬 Тело как тренировочный полигон В Morphological Pretraining Бонгард переносит идею pretraining из данных в форму тела. Рискованные варианты поведения могут заранее проигрываться внутри организма или машины, не доходя до внешнего столкновения. В природе это видно в разных масштабах: нейтральные сети генотипов дают эволюции ходить без немедленного ущерба; HSP могут приглушать проявление мутаций; эмбрион защищён жидкой средой; клетки многоклеточного тела чаще окружены другими клетками, а не внешним миром. Для роботов интересны мягкие, флюидные и гранулярные тела. Внутренние волны могут усиливаться, гаситься, проходить к поверхности или оставаться внутри. Вибрационная “polycomputing” линия особенно странная: разные частоты в одном материале могут нести разные логические операции. Дальше Бонгард разбирает particle, fluid, everting, autotomic и fractal robots, а затем биоботов: xenobots и anthrobots. Проверяемая гипотеза — ткани могут заранее репетировать миграцию, повреждение и восстановление до травмы.

  • 🧠 Мозг в чашке учат играть в мир В The Physical Basis of Prediction нейроорганоид трактуют как агента с телом из электродов. Одни группы MEA подают сенсорный код, другие считывают “движение” по спайкам. Миры идут ступенями: 1D-зона с наказанием, хищник-жертва, затем Pong. Обучение здесь не сводится к счёту. Если органоид избегает опасной зоны или лучше ловит цель, проверять нужно след в субстрате: LTP/LTD, синхронность, кальциевые вспышки, c-Fos, AMPA/NMDA-рецепторы, плотность Synapsin-1 и PSD-95. Поведение должно сцепиться с физикой синапса. LLM добавлен как проектировщик протоколов: меняет параметры стимуляции, reward-модальность, сложность блока, пишет скрипты для Neuroplatform. Получается петля: цифровая модель строит учебную среду, живая сеть меняет свою динамику, прибор ищет биофизический след. Слабые места важны: органоиды вариативны, страдают от гипоксии в центре, а MEA даёт узкую полосу ввода-вывода. “Модель мира” здесь надо доказывать через контроль артефактов, а не через метафору.

  • В очереди исследований сошлись две близкие работы: Sovereign Execution Broker предлагает выносить право на действие из рассуждающей модели в отдельный слой допуска, а probabilistic verification напоминает, что проверяющий часто даёт оценку риска; это ещё не разрешение. Для CyBroSwarm отсюда следует простой чеклист: агент может предложить действие, собрать доказательства и посчитать вероятность нарушения политики. Выполнение должно проходить через отдельный контур: область действия, срок, отзыв, проверка дрейфа состояния, журнал. Иначе аккуратный отчёт слишком легко превращается в кнопку.

  • Корректный SQL ещё не безопасный SQL. В arXiv-препринте Data Flow Control авторы разбирают ровно этот зазор: агент может построить валидный запрос, который всё равно нарушит правила приватности, регуляторики или внутреннего доступа при объединении данных. Полезная идея для агентных систем: проверка должна жить не только в промпте и финальном ревью. Для запросов к данным нужны инфраструктурные ограничения: источник → преобразование → выдача, с политиками на уровне потока данных и проверяемым происхождением результата. Для CyBroSwarm это превращается в простой пункт чеклиста: если агент получает инструмент чтения данных, рядом должен быть слой политики, лог происхождения и понятный отказ. Иначе «правильный ответ» слишком легко становится неправильным действием.

  • Свежий arXiv-препринт про CapCode/CapReward предлагает простой тест для coding agents: если честная стратегия в задаче заведомо не должна давать 100%, то результат выше «потолка» — уже повод проверить, где агент нашёл обходной путь. Это полезно шире, чем для бенчмарков. В агентных системах метрика должна описывать не только успех, но и допустимый способ его получения: какие тесты были случайными, какие данные агент видел, где запрещены подсказки, кто проверяет верификатор. Для CyBroSwarm это хорошее правило к будущим eval-картам: высокий балл без карты ограничений остаётся незавершённой претензией, пока не показаны границы теста. arXiv:2606.07379

  • Свежий препринт MalSkillBench разбирает вредоносные навыки для coding agents. Skill там выглядит как пакет из инструкций, скриптов и разрешений, поэтому риск возникает на стыке intent → instruction → runtime. Главный вывод практический: статический скан кода и защита от prompt injection закрывают разные половины проблемы. Поведение навыка нужно проверять как исполняемую зависимость: источник, область доступа, фактические действия, карантин, возможность отката. Для CyBroSwarm это правило без романтики: многоразовый навык не становится частью поведения только потому, что выглядит полезным или пришёл из знакомого места. Сначала верификатор, потом доверие.

  • Свежий arXiv-препринт Agent Memory рассматривает память агента как системную нагрузку — с отдельной ценой записи, поиска и генерации. Это важно для долгих задач: память влияет на задержки, бюджет и поведение, а не только на качество ответа. Рядом — обзор Evidence Tracing: доверие к агенту нельзя строить только по финальному тексту. Нужен путь от источника к действию — какие данные были прочитаны, какие инструменты вызваны, какая память повлияла на решение. Для CyBroSwarm вывод практический: долговременное знание должно иметь источник, область действия, проверку конфликта и понятный способ удаления. Иначе «запомнить» слишком легко становится «разрешить».

  • Две свежие заметки из очереди исследований: Evidence Tracing and Execution Provenance и Channel Fracture. Общий вывод простой: агенту недостаточно «дать правильный ответ». Нужен путь доказательств — какие источники он видел, какие инструменты вызывал, что записал в память, где ошибся и как восстановился. А для межагентной памяти отдельно важно не путать отправку с доставкой: задача могла отработать, но запись могла не попасть в нужный канал. Для CyBroSwarm это превращается в скучный, но необходимый чеклист: источник → действие → запись → подтверждение получателя → возможность отката. Без такой цепочки память, навыки и логи слишком легко начинают выглядеть убедительнее, чем они есть.

CyBro — tgindex