BaseLine
СтатистикаКанал Алексей Ковалёва – PhD, тимлид команды Embodied agents в AIRI, доцент ЦКМ МФТИ. Занимаюсь Embodied AI 🤖, LLM Planning, RL Моё хобби – читать научпоп лекции по ИИ Здесь делюсь событиями, мыслями, новостями
- Последний пост
- 10 июл.
- Последнее чтение
- 11:59
- Постов за неделю
- 0
- Всего постов
- 24
- Тип
- открытый
- Язык
- русский
- Категория
- Новости и СМИ
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- —
- 1/48двое суток
- —
- 1/72трое суток
- —
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
RLWRLD запустил интересный сайт All Hands Up ! с подборкой ловких рук 🖐 На нём можно посмотреть URDF, спецификацию, подвигать ползунками каждый джойнт и почитать про опыт работы с такими руками 🔥
Наглядно про рост количества статей с велком ремакс ICML 2026
Всем привет! Сейчас в Южной Корее проходит одна из топовых конференций по ИИ – ICML 2026. На ней мы представляем одну работу на мейн треке и две на воркшопах. 🚀 KAGE-Bench: Fast Known-Axis Visual Generalization Evaluation for Reinforcement Learning 🗓️ Main track, Jul 7, 2:00 – 3:45, HALL A #4409 🚀 (Oral!) Don’t Blind Your VLA: Aligning Visual Representations for OOD Generalization 🗓️ SCALE Workshop – Jul 10, Ballroom 201 🚀 VLA Grounder: Language-Conditioning Space Optimization for Black-Box VLA Models 🗓️ DEMO Workshop – Jul 11, Ballroom 203 Если вы на конференции, приходите пообщаться и обсудить работы 🤗
Всем привет! Выложили нашу работу “Does VLA Even Know the Basics?” в Daily Papers на Hugging Face 🤗 В статье мы задаёмся простым, но пока почти не изученным вопросом: есть ли в VLA-моделях commonsense знания о мире? 📚 ⚡️Мы предлагаем Act2Answer: бенчмарк, где VLA модель отвечает на вопросы не текстом, а действием - кладёт куб на правильный вариант. Проверили 7 VLA и 9 VLM моделей на 12 категориях. 💡Интересные инсайты из работы: → VLA хорошо понимают примитивные концепты по типу Цвета и Формы → На более сложных категориях (Эмоции, Животные, Симметрия, Время, Счет, История) у VLA сильный дроп в сравнении с VLM → Знания есть в весах VLA моделей, однако они не транслируются в действия → Котрейнинг на VL данных хорошо помогает сохранять знания → SFT/RL файтюнинг на downstream роботикс задачах дергадирует знания Поддержите нас апвоутом пожалуйста ❤️
О ключевом элементе в развитии современных роботов — памяти⤵️ Егор Черепанов, младший научный сотрудник группы «Воплощённые агенты» лаборатории когнитивных систем искусственного интеллекта Института AIRI, рассказывает в интервью «Ъ-Науке»: ⚫️что исследователи обычно имеют в виду, говоря о памяти робота ⚫️зачем она нужна современным роботам и какие проблемы могут возникать, если они «не помнят» ⚫️почему адаптация оказывается сложной задачей для роботов ⚫️как работать с памятью и где она хранится 📎Читайте материал по ссылке.
🔥Всем привет! 📆Завтра (05.06) в 17:00 Егор Черепанов, Алексей Староверов и Татьяна Земскова разберут архитектуру и методы обучения и инференса модели RLDX-1 от корейского стартапа RLWRLD и обсудят, почему эту работу уже можно считать заметным вызовым современным VLA-моделям. ⚫️Авторы предлагают VLA-архитектуру для мобильной манипуляции, которая объединяет память на разных уровнях, тактильные сигналы, синтетические данные для редких сценариев и оптимизации инференса для работы в реальном времени. ⚫️Отдельно будет уделено внимание архитектуре MSAT, где разные модальности обрабатываются отдельными потоками и затем связываются через совместное self-attention. ⚫️Также будет разобрано, как эти инженерные и модельные решения переводятся в практический результат: RLDX-1 работает на частоте до 22 Гц на RTX 5090, а в экспериментах на реальном роботе и в симуляции заметно превосходит сильные базовые модели, включая π0.5 и NVIDIA GR00T N1.6. В частности, в задачах для гуманоидного робота ALLEX модель достигает 86.8% успеха против примерно 40% у конкурентов. ⚫️На семинаре обсудим, насколько эти результаты делают RLDX-1 серьёзным конкурентом для Pi0.7 и других SOTA VLA, а также посмотрим, что особенно важно для сообщества: у работы уже доступны код и веса. Ссылки: 1. Технический репорт 2. Код и веса моделиr 🍿Ссылка на подключение Подписаться⤵️ Embodied AI Reading Club
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
Завершилась конференция AAMAS 2026 Международная конференция по автономным агентам и многоагентным системам в этом году проходила с 25 по 29 мая в городе Пафос, Кипр. На ней исследователи лаборатории когнитивных систем искусственного интеллекта AIRI Александр Панов, Алексей Скрынник, Алексей Ковалёв, Егор Черепанов, Мария Нестерова и Антон Андрейчук представили 3 работы⤵️ 📎Don't Blind Your VLA: Aligning Visual Representations for OOD Generalization 📎Memory Retention Is Not Enough to Master Memory Tasks in Reinforcement Learning 📎MARL-GPT: Foundation Model for Multi-Agent Reinforcement Learning Делимся фотографиями с Кипра📷 #AIRIнаКонфе
Друзья! Мы с командой @amazing_research просим помочь с проведением пользовательского исследования для статьи Задача — оценить реалистичность автоматически сгенерированных текстовых контекстов для персонализированной рекомендации фильмов Прохождение задания занимает около 5 минут и не требует специальных знаний Telegram-бот: @RecSysUserStudyBot Заранее спасибо всем, кто пройдет! Важно пройти его до 5го июня, чтобы мы успели обработать результаты 🤗
🪼 — До конца подачи заявок в магистратуру ЦКМ осталось 2 дня — делимся историями наших студентов! Первый гость интервью: Максим Бредихин, выпускник бакалавриата МГТУ им. Н. Э. Баумана, студент магистратуры ЦКМ. В Центре он занимается full-body control — это методы, которые позволяют мобильным манипуляторам и антропоморфным роботам расширять свои возможности за счет движения всего тела, а не только отдельных частей. Как узнал о ЦКМ? На ROS Meetup. Там я пообщался со студентами и сотрудниками Центра, они рассказали про проекты внутри ЦКМ и про магистерскую программу. Решил поступать именно сюда, так как многие темы были близки с моей научной и профессиональной деятельностью. Почему именно магистратура ЦКМ? Меня привлёк разнообразный набор дисциплин: можно глубоко погрузиться в предметную область, разобраться в современных SOTA-методах и в дальнейшем начать писать научные статьи. Также для меня важно, что преподаватели — это действующие исследователи, публикующие A* статьи, которые делятся своим опытом и всегда открыты к сотрудничеству и нетворкингу. Отдельно привлекает техническая возможность работать с реальными роботами и оборудованием, чтобы проверять свои гипотезы не только в симуляции, но и на железе. Следующая история может быть ваша! Подавайте заявку на собеседование в магистратуру ЦКМ до 1 июня. Подробнее. Поддержим Максима реакциями🪼
🎓 — Семинар 16. Обобщаемость VLA моделей, выравнивание текстово-визуальных представлений в VLA моделях | Никита Качаев На семинаре разберёмся, почему VLA-модели после дообучения начинают «забывать», терять фокус и тексто-языковое понимание при обучении на малых робототехнических датасетах, и как метод выравнивания визуальных представлений помогает это исправить. А также на примере результатов на бенчмарке VL-Think посмотрим, насколько хорошо VLA модели усваивают знания из повседневной жизни. 📎Github 👉🏻 Дата: 21.05.26, четверг в 17:00 📹 Трансляция: Youtube или ВК Подключайтесь к живому обсуждению и задавайте вопросы в прямом эфире! Ждем всех! #семинары #VLA
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
🦾 — Продолжается набор в магистратуру ФПМИ МФТИ по искусственному интеллекту и робототехнике! Поступление проходит по 2 направлениям: — “Фундаментальные методы искусственного интеллекта” – база ЦКМ, 25 мест — “Мультимодальный искусственный интеллект”– база Институт AIRI, 10 мест Для поступления необходимо: 🪼Заполнить заявку на нашем сайте до 1 июня и пройти собеседование в Центре. 🪼Подать документы на сайте приёмной комиссии МФТИ и успешно пройти вступительные испытания. В Центре под руководством ведущих специалистов в своих областях вы сможете заниматься написанием статей на передовые конференции А* (NeurIPS, ICLR, ICML, IJCAI и др.), а также работать над прикладными проектами по тематикам: 🪼Обучение с подкреплением для задач робототехники (манипуляция, навигация) 🪼Мультимодальные карты знаний в компьютерном зрении и робототехнике 🪼Компьютерное зрение для задач робототехники и беспилотного транспорта 🪼Большие языковые и мультимодальные модели для генерации действий в роботототехнике 🪼Мультимодальные среды и модели в обучении с подкреплением 🪼Заполняйте зявку на прохождение собеседования до 1 июня! Информация для поступающих есть на сайтах ЦКМ и приёмной комиссии.
Исследователи AIRI представили модель, которая может запоминать многое, не увеличивая потребность в вычислениях Робот часто видит важную информацию задолго до того, как её необходимо использовать. Если система не умеет надёжно хранить и вовремя извлекать данные, ей трудно действовать в сложной и меняющейся среде. Обычные трансформеры решают эту задачу не полностью: одни модели становятся слишком дорогими по вычислениям, другие плохо контролируют, что именно забывается. В ELMUR каждый слой содержит фиксированное количество слотов памяти, которые параллельно взаимодействуют с основным потоком данных. Система может читать информацию из этих ячеек, когда принимает решение, и записывать туда новые данные. Если память начинает заполняться — обновляются те ячейки, которые использовались реже всего. Это даёт ИИ компактное, но устойчивое хранилище, которое может удерживать важную информацию на протяжении 100 тысяч шагов за пределами обычного окна внимания. О разработке рассказали на ICLR 2026. Научная статья | CNews
Одна из наших статей с ICLR 2026🦾