BaseLine
описание
Канал Алексей Ковалёва – PhD, тимлид команды Embodied agents в AIRI, доцент ЦКМ МФТИ. Занимаюсь Embodied AI 🤖, LLM Planning, RL Моё хобби – читать научпоп лекции по ИИ Здесь делюсь событиями, мыслями, новостями
535
подписчиков
Охват к подписчикам
93,3%
ERR
Реакции к просмотрам
1,21%
145 на 24 постов
Пересылки к просмотрам
0,78%
93
Постов в день
0,0
всего 24
Где отзываются чаще
доля реакций к просмотрам- 1 июн.Завершилась конференция AAMAS 2026 Международная конференция по автономным агентам и многоагентным системам в этом году проходила с 25 по 29 мая в городе Пафос, Кипр. На ней исследователи лаборатории когнитивных систем искусственного интеллекта AIRI Александр Панов, Алексей Скрынник, Алексей Ковалёв, Егор Черепанов, Мария Нестерова и Антон Андрейчук представили 3 работы⤵️ 📎Don't Blind Your VLA: Aligning Visual Representations for OOD Generalization 📎Memory Retention Is Not Enough to Master Memory Tasks in Reinforcement Learning 📎MARL-GPT: Foundation Model for Multi-Agent Reinforcement Learning Делимся фотографиями с Кипра📷 #AIRIнаКонфе3,04%
- 26 июн. 2025 г.Сегодня провели защиты дипломов магистров Научно-образовательного Центра когнитивного моделирования МФТИ. Появилось 14 новых магистров по профилю подготовки «Методы и технологии искусственного интеллекта». Мои поздравления и пожелания дальнейших успехов защитившимся! Среди них было шестеро моих дипломников и про них я напишу чуть позже отдельные посты, открыв рубрику «Отзыв научного руководителя» 😊 А также большая благодарность членам комиссии, в которую я входил и которая собралась на Физтехе и задавала дельные вопросы: В.В. Борисову, Д.В. Виноградову, К.С. Яковлеву, А.К. Ковалёву и А.И. Панову, который нас всех собрал. А также отдельное спасибо Анфисе Мухиной, которая обеспечила техническую сторону защиты и делает большую работу в новой приемной кампании! PS. Запись защиты дипломов доступна в ВК. #Activities3,04%
- 30 апр.Исследователи AIRI представили модель, которая может запоминать многое, не увеличивая потребность в вычислениях Робот часто видит важную информацию задолго до того, как её необходимо использовать. Если система не умеет надёжно хранить и вовремя извлекать данные, ей трудно действовать в сложной и меняющейся среде. Обычные трансформеры решают эту задачу не полностью: одни модели становятся слишком дорогими по вычислениям, другие плохо контролируют, что именно забывается. В ELMUR каждый слой содержит фиксированное количество слотов памяти, которые параллельно взаимодействуют с основным потоком данных. Система может читать информацию из этих ячеек, когда принимает решение, и записывать туда новые данные. Если память начинает заполняться — обновляются те ячейки, которые использовались реже всего. Это даёт ИИ компактное, но устойчивое хранилище, которое может удерживать важную информацию на протяжении 100 тысяч шагов за пределами обычного окна внимания. О разработке рассказали на ICLR 2026. Научная статья | CNews2,57%
- 6 июл.Всем привет! Сейчас в Южной Корее проходит одна из топовых конференций по ИИ – ICML 2026. На ней мы представляем одну работу на мейн треке и две на воркшопах. 🚀 KAGE-Bench: Fast Known-Axis Visual Generalization Evaluation for Reinforcement Learning 🗓️ Main track, Jul 7, 2:00 – 3:45, HALL A #4409 🚀 (Oral!) Don’t Blind Your VLA: Aligning Visual Representations for OOD Generalization 🗓️ SCALE Workshop – Jul 10, Ballroom 201 🚀 VLA Grounder: Language-Conditioning Space Optimization for Black-Box VLA Models 🗓️ DEMO Workshop – Jul 11, Ballroom 203 Если вы на конференции, приходите пообщаться и обсудить работы 🤗2,30%
- 9 июн.О ключевом элементе в развитии современных роботов — памяти⤵️ Егор Черепанов, младший научный сотрудник группы «Воплощённые агенты» лаборатории когнитивных систем искусственного интеллекта Института AIRI, рассказывает в интервью «Ъ-Науке»: ⚫️что исследователи обычно имеют в виду, говоря о памяти робота ⚫️зачем она нужна современным роботам и какие проблемы могут возникать, если они «не помнят» ⚫️почему адаптация оказывается сложной задачей для роботов ⚫️как работать с памятью и где она хранится 📎Читайте материал по ссылке.2,14%
- 21 мая🎓 — Семинар 16. Обобщаемость VLA моделей, выравнивание текстово-визуальных представлений в VLA моделях | Никита Качаев На семинаре разберёмся, почему VLA-модели после дообучения начинают «забывать», терять фокус и тексто-языковое понимание при обучении на малых робототехнических датасетах, и как метод выравнивания визуальных представлений помогает это исправить. А также на примере результатов на бенчмарке VL-Think посмотрим, насколько хорошо VLA модели усваивают знания из повседневной жизни. 📎Github 👉🏻 Дата: 21.05.26, четверг в 17:00 📹 Трансляция: Youtube или ВК Подключайтесь к живому обсуждению и задавайте вопросы в прямом эфире! Ждем всех! #семинары #VLA2,11%
- 1 июл.Всем привет! Выложили нашу работу “Does VLA Even Know the Basics?” в Daily Papers на Hugging Face 🤗 В статье мы задаёмся простым, но пока почти не изученным вопросом: есть ли в VLA-моделях commonsense знания о мире? 📚 ⚡️Мы предлагаем Act2Answer: бенчмарк, где VLA модель отвечает на вопросы не текстом, а действием - кладёт куб на правильный вариант. Проверили 7 VLA и 9 VLM моделей на 12 категориях. 💡Интересные инсайты из работы: → VLA хорошо понимают примитивные концепты по типу Цвета и Формы → На более сложных категориях (Эмоции, Животные, Симметрия, Время, Счет, История) у VLA сильный дроп в сравнении с VLM → Знания есть в весах VLA моделей, однако они не транслируются в действия → Котрейнинг на VL данных хорошо помогает сохранять знания → SFT/RL файтюнинг на downstream роботикс задачах дергадирует знания Поддержите нас апвоутом пожалуйста ❤️1,92%
- 30 апр.🎓 — Семинар 13. Детектирование неоднозначных инструкций на естественном языке | Дарья Гиталова В докладе рассматривается проблема неоднозначности инструкций на естественном языке роботу, которая приводит к множественности интерпретаций и потенциальным рискам при исполнении. Рассмотрим два подхода к детектированию неоднозначности: фреймворк GRICE (Grice’s Robotic Instruction Clarity Evaluation), операционализирующий кооперативный принцип Пола Грайса через нарушение максим Количества, Качества, Отношения и Способа на основе комбинации символических признаков и LLM-оценок, и метод SVC (Semantic Valency Conflict), выявляющий конфликты между конкурирующими семантическими фреймами при неспецифицированных аргументных позициях предиката. 👉🏻 Дата: 30.04.26, четверг в 17:00 📹 Трансляция: ВК Подключайтесь к живому обсуждению и задавайте вопросы в прямом эфире! Ждем всех! #семинары #LLM1,91%
- 24 апр. 2025 г.Субъективная подборка статей за первый день ICLR 2025 #ICLR2025 #Day1 1. On the Modeling Capabilities of Large Language Models for Sequential Decision Making — применяют LLM как для моделирования стратегии, так и в качестве функции вознаграждения 2. MrSteve: Instruction-Following Agents in Minecraft with What-Where-When Memory — добавили агенту в Minecraft иерархическую память 3. ADAM: An Embodied Causal Agent in Open-World Environments — обычно агенты полагаются на заранее известное верное дерево развития технологий (деревянная кирка = дерево + палка). В этой работе предлагают отказаться от априорных знаний (на самом деле используют испорченное дерево развития без нужных или с лишними связями) и стоить его в процессе взаимодействия со средой 4. TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies — дообучают OpenVLA на картинках, на которых нарисована траектория гриппера, тем самым улучшая значения метрик. На инференсе подается как картинка с камеры, так и она же с дорисованным «трейсом» 5. ThinkBot: Embodied Instruction Following with Thought Chain Reasoning — CoT для Embodied AI в духе ALFRED. Очень созвучна с ECoT. Чуть лучше модифицированного Promptera c переобученным детектором объектов и памятью 6. EMOS: Embodiment-aware Heterogeneous Multi-robot Operating System with LLM Agents — LLM-планировщик для группы роботов 7. ManiSkill-HAB: A Benchmark for Low-Level Manipulation in Home Rearrangement Tasks — интересная среда на основе ManiSkill от подмножества авторов ManiSkill3. Ещё бы навигация по сцене была бы не через телепортацию 8. Dream to Manipulate: Compositional World Models Empowering Robot Imitation Learning with Imagination — real2sim2real подход. Снимаем сцены, моделируем с помощью Gaussian Splatting, генерируем в полученной среде новые траектории, дообучаем на этом стратегию — Profit! 9. HASARD: A Benchmark for Vision-Based Safe Reinforcement Learning in Embodied Agents — бенч для Safe RL на основе VizDoom 10. VICtoR: Learning Hierarchical Vision-Instruction Correlation Rewards for Long-horizon Manipulation — ещё одна reward-модель 11. Drama: Mamba-Enabled Model-Based Reinforcement Learning Is Sample and Parameter Efficient — Mamba-2 как бэкбон. Бьёт IRIS. Странно что нет сравнения с R2I, возможно из-за того, что эксперименты на Atari100K, или, как пишут авторы, чуть хуже результаты чем у DreamerV3 12. What Matters in Learning from Large-Scale Datasets for Robot Manipulation — пытаются ответить на вопрос как надо собирать демонстрации, чтобы модели лучше обучались. Некоторые тейкэвеи выглядят сомнительно, например про разнообразие поз камеры при сборе данных 13. GROOT-2: Weakly Supervised Multimodal Instruction Following Agents — ещё один агент для Minecraft'а и не только1,67%
- 16 июл. 2025 г.без подписи1,59%
- 7 июл.Наглядно про рост количества статей с велком ремакс ICML 20261,38%
- 10 июл.RLWRLD запустил интересный сайт All Hands Up ! с подборкой ловких рук 🖐 На нём можно посмотреть URDF, спецификацию, подвигать ползунками каждый джойнт и почитать про опыт работы с такими руками 🔥1,33%