CognitiveRobotics
СтатистикаЯ — Артем Лыков, руководитель направления Physical AI в МТС Web Services и учёный в области когнитивной робототехники. В этом канале я делюсь своим личным взглядом: что действительно важно, куда движется наука и технологии, и как это меняет наш мир.
- Последний пост
- 6 авг.
- Последнее чтение
- 18:41
- Постов за неделю
- 0
- Всего постов
- 23
- Тип
- открытый
- Язык
- русский
- Категория
- Технологии
- В каталоге с
- 13 авг.
- 1/24сутки в ленте
- 164
- 1/48двое суток
- 187
- 1/72трое суток
- 202
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
На vc.ru вышла колонка по мотивам моего разговора в подкасте «Ноосфера» — о роботах-гуманоидах, Physical AI и о том, что на самом деле стоит за словами «робот становится умнее» 🤖 Разобрали, почему гуманоидная форма — не самоцель, какие задачи физический ИИ уже начинает забирать у классической автоматизации и почему для масштабирования роботов критична именно агентная архитектура. Отдельно поговорили о CognitiveOS: как соединить восприятие, рассуждение, планирование и физические навыки в одну систему; почему ее модули должны быть заменяемыми; и как это позволит роботам становиться лучше по мере развития базовых моделей, а не требовать пересборки всей платформы с нуля. В основе текста — практический взгляд на путь к автономным роботам: какие задачи уже можно автоматизировать, где остаются инженерные ограничения и какую роль в этом играет агентная архитектура. Почитать можно здесь: https://vc.ru/ai/3055826-roboty-gumanidy-i-fizicheskiy-ii-budushchee-avtomatizatsii
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
Снова ISMAR 2026 ⚡️ Как и обещал, возвращаюсь со второй статьей, принятой на конференцию. «ORCESTRA: VLM-driven Visual Robot Programming in Mixed Reality» Авторы: Ivan Snegirev, Elizaveta Semenyakina, Mikhail Konenkov, Artem Lykov, Miguel Altamirano Cabrera, Dzmitry Tsetserukou. Препринт: https://arxiv.org/abs/2608.00775 Если AgenticFocus был про то, как дать роботу новые навыки через наблюдение за человеком, то ORCESTRA — про то, как удобно дать роботу задачу и убедиться в ее безопасности перед выполнением. В основе работы — Mixed Reality-интерфейс для программирования цифровых двойников роботов. Пользователь может буквально разместить виртуального робота в своем физическом пространстве, показать ему траекторию движением руки без написания кода или поставить задачу голосом либо текстом. Дальше в дело вступает VLM: она преобразует команду в структурированный план для цифрового двойника. Система проверяет, достижима ли задача для конкретной конфигурации робота, показывает результат до запуска и только после подтверждения переносит план на физическую платформу. То есть перед реальным действием робот сначала «проигрывает» задачу в смешанной реальности. Это дает удобный слой проверки и безопасности — особенно для команд, сформулированных естественным языком. Важный момент: подход не привязан к одному роботу. Мы показали его на нескольких типах платформ — стационарных манипуляторах, мобильной базе и гуманоиде. ORCESTRA — еще один шаг к тому, чтобы взаимодействие с роботами стало ближе к постановке задачи человеку: не программировать каждое движение, а показать, объяснить, проверить и запустить 🚀
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
🔥 Хорошие новости: сразу две наши статьи приняты на ISMAR 2026 — конференцию уровня A* в области смешанной и дополненной реальности. Первая — «AgenticFocus: Object-Preserving Mixed Reality Synthesis from Human FPV Video for Dexterous Humanoid Learning». Авторы: Iaroslav Kolomiets*, Artem Lykov*, Miguel Altamirano Cabrera*, Jeffrin Sam, Dmitrii Iarchuk, Yara Mahmoud, Daniia Zinniatullina, Mikhail Konenkov, Dzmitry Tsetserukou. *Равный вклад. Препринт: https://arxiv.org/abs/2607.08857 Это первая публикация с двойной аффилиацией MWS R&D и Сколтеха. В ISR Lab мы давно делаем сильные исследования и публикуемся в области робототехники и Physical AI. Для MWS R&D это первая публикация в Physical AI — и сразу на площадке такого уровня 🔥 О чем сама работа? AgenticFocus — это пайплайн для обучения гуманоидных роботов через демонстрации. Мы берем обычное видео от первого лица, в котором человек выполняет задачу руками, и превращаем его в демонстрацию, пригодную для обучения робота. Система восстанавливает геометрию объектов, перекрытых руками, реконструирует движения кистей и переносит их на гуманоидное тело. В результате получаются синхронизированные визуальные наблюдения, действия и состояния робота — данные, на которых можно обучать манипуляционным навыкам. По сути, это еще один важный шаг к learning by watching: робот учится новым физическим действиям, наблюдая за человеком. Принятие на конференцию уровня A* — важное подтверждение того, что научная составляющая нашей работы находится на мировом уровне. Для нашей команды это очень приятный и мотивирующий результат — продолжаем двигаться дальше 🚀 И это только первая из двух принятых работ. Чуть позже вернусь со второй публикацией — там тоже есть чем поделиться⚡️
Вышел подкаст «Ноосфера» с моим участием 🎙 Поговорили о главном: — Как реализуется агентность в робототехнике. — Как работают каналы восприятия и искусственная сенсорика. — Куда прямо сейчас движется Physical AI и как технологии переходят из лабораторий в реальный мир. Разговор получился отличным. Если вам интересна тема агентной робототехники и того, как умные роботы учатся взаимодействовать с нашим физическим миром — искренне рекомендую к просмотру 👀 Смотреть на YouTube: https://youtube.com/watch?v=AghYLMpDzmo #PhysicalAI #Робототехника #Подкаст #Ноосфера
Что меняется, когда ИИ выходит из чата и сталкивается с реальным миром? 🦾 Вместе с Артёмом Лыковым — руководителем направления Physical AI в MWS RnD — разбираем, как устроен современный робот: от восприятия среды до планирования и управления движением. 🔴Почему модели, которые отлично работают в софте, могут ошибаться в физическом мире? 🔴Насколько реальны гуманоидные роботы из вирусных видео? 🔴Когда роботы станут привычной частью повседневной жизни. Смотреть подкаст — по ссылке! #TrueTechPodcast@truetechcommunity
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
Рад поделиться отличными новостями 🚁 Наша статья официально принята на IROS 2026 (IEEE/RSJ International Conference on Intelligent Robots and Systems). В этом году отбор был строгим: acceptance rate составил 36% (принято 1585 работ из 4348 поданных). Название публикации: «CognitiveDrone: A VLA Model and Evaluation Benchmark for Real-Time Cognitive Task Solving and Reasoning in UAVs». Работа рассказывает про, на мой взгляд, недоисследованный топик — применение Vision-Language-Action (VLA) моделей для беспилотных систем. В рамках исследования мы сфокусировались на адаптации и дообучении VLA-решений для задач умных дронов-компаньонов, способных безопасно помогать человеку в повседневных делах в реальном мире. Основной акцент в работе сделан на создании специализированного бенчмарка. Мы разработали метрики и среду для комплексной оценки того, насколько эффективно дрон способен анализировать визуальный контекст, планировать маршруты с учетом препятствий и принимать решения в режиме реального времени. Препринт статьи доступен на arXiv: http://arxiv.org/abs/2503.01378 📄
По результатам ICRA 2026 мы оформили на Хабре отдельный текст про то, что сейчас происходит в Physical AI: какие направления развиваются быстрее других, какие компании и университеты задают тон и какие работы с конференции стоит считать опорными для ближайших лет. Если не было времени следить за ICRA в онлайне, можно просто зайти на Хабр — там в более удобном формате собраны главные выводы, ссылки на статьи и общие впечатления!
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
Наконец-то нашёл минутку в аэропорту Стамбула между перелётами, чтобы, пока ещё свежие впечатления, собрать финальный пост по ICRA. ICRA2026 завершилась. Это были очень яркие 5 дней. За эту неделю мы: – представили нашу научную работу на одной из технических сессий; – провели целое море времени на постерных секциях; – обошли экспо и поговорили с командами, которые сейчас задают тон в Physical AI. Чётче всего за эти дни проявилось трёхслойное разделение задач на System 0, System 1 и System 2. 1) System 0 — Full Body Control и loco-manipulation. На этом уровне было много сильных работ про whole-body контроль и устойчивое поведение под возмущениями. Видно, как community постепенно переходит от «робот умеет ходить по сценарию» к тому, чтобы одна политика объединяла ходьбу, бег, восстановление после падения и переходы между скиллами без жёстких FSM. В отдельный тренд выходит cross-embodiment: латентные представления, в которых одна политика управляет сразу несколькими роботами с разной кинематикой. Отдельно забавно было видеть, как тема локоманипуляции стала настолько горячей, что если в лаборатории нет гуманоида, в ход идут квадроподы — главное, чтобы одновременно шевелились «ноги» и «руки». 2) System 1 — VLA, данные и embodiment gap. Здесь почти все упираются в одно и то же: дефицит качественных данных и разрыв между человеческими и роботными демонстрациями. На уровне методов: – аккуратно используют human demos через шумовые процедуры и классификаторы, которые «подтягивают» человеческие действия к роботным; – исследуют behavior-aligned репрезентации (особенно по траекториям энд-эффектора), чтобы переносить навыки между разными платформами; – усиливают симуляционную инфраструктуру: цифровые двойники, offline-режимы и более умные pipelines сбора/фильтрации траекторий. Всё это очень хорошо стыкуется с тем, что мы уже обсуждали: архитектуры System 1 становятся более‑менее понятными, а настоящий bottleneck — в данных, их качестве, разнообразии и правильной организации. 3) System 2 — планирование и интерфейсы. На верхнем уровне продолжают искать способы строить длинные планы поверх уже существующих навыков и VLA-политик. – Планировщики вроде TASP показывают, как оборачивать разнородные «black box» навыки в геометрические абстракции и при этом не терять способность к TAMP‑подобному рассуждению. – В навигации по языковым инструкциям видно, как MLLM‑уровень сочетается с довольно простыми, но аккуратно спроектированными waypoint‑предикторами и топологическими графами. – В прикладных задачах (тот же surgery-сценарий) появляются интерфейсы, где высокоуровневая система работает с полной сценой, а на уровень VLA уходит уже очищенное визуальное представление с релевантными объектами. Отдельной звездой конференции была NVIDIA и их GEAR‑группа, которая действительно остаются на переднем крае. SONIC, DreamZero, COMPASS и их подход к данным задают очень высокий «baseline» для всей остальной индустрии. Но вокруг уже сформировался плотный пояс академических и индустриальных команд, которые закрывают отдельные куски системы: loco-manip, cross-embodiment transfer, тактильную двуручную манипуляцию, робастное восприятие из видео и т.д. Для CognitiveOS эта конференция была полезна тем, что: – ещё раз убедились, что наше разделение на System 0/1/2 совпадает с тем, к чему пришла топовая часть community; – собрали конкретные идеи по Full Body Control, работе с данными и интеграции VLA/World Action моделей в более крупную архитектуру. Дальше уже в более спокойном режиме нам предстоит ещё раз пройтись по тем работам, которые мы отобрали на конференции, и аккуратно примерить их к нашей практике. Где‑то это будет вопрос прямого внедрения в прод (например, как готовый модуль или библиотека), где‑то — аккуратного тестирования и прототипов, а где‑то — переосмысления идей под наши сценарии. В любом случае, после ICRA у нас есть хороший ориентир того, какие направления действительно двигают Physical AI вперёд, и где нам стоит усиливать CognitiveOS.