Ruslan Rakhimov × world models × vlm agents × 3d
Статистика- Последний пост
- 2 июл.
- Последнее чтение
- 15 авг.
- Постов за неделю
- 0
- Всего постов
- 21
- Тип
- открытый
- Язык
- русский
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- —
- 1/48двое суток
- —
- 1/72трое суток
- —
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Накатывал фиксы, лидерборд обнулен, но зато Т теперь подгонит подарки первым топ 3 лидерборда
#6 из 8, лосс 4.9e-6 и ни одного NaN 😎
18 июля буду рассказывать про модели мира и что с командой сделали в этом направлении, приходите! Будут также и другие доклады, регистрация и программа по ссылке: https://mlconf.t-bank.ai
18 июля буду рассказывать про модели мира и что с командой сделали в этом направлении, приходите! Будут также и другие доклады, регистрация и программа по ссылке: https://mlconf.t-bank.ai
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
Съездили в 🔤🔤🔤🔤🔤🔤 на AAMAS 2026, где у нас был oral с работой Enhancing Vision-Language Model Training with Reinforcement Learning in Synthetic Worlds for Real-World Success. В статье мы обучаем VLM-агентов через RL в дешевых синтетических средах: MiniWorld, Gym-Cards, ALFWorld и WebShop. Основная идея — если хотим, чтобы модель не просто красиво описывала картинку, а умела смотреть на состояние мира и делать последовательность действий, то ей нужно дать возможность потренироваться в интерактивных окружениях. Для этого предложили VL-DAC: простой RL-метод, где PPO применяется к action-токенам, а value учится один раз на шаг среды. В итоге убираем хрупкие коэффициенты между thought/action токенами, replay buffers и прочие места, где обычно хочется немного поплакать во время обучения VLM через RL. После обучения в одном дешевом симуляторе модель переносит навыки на реальные бенчмарки: +50% relative на BALROG, +5% на самой сложной части VSI-Bench и +2% на VisualWebBench, при этом не ломая обычное понимание изображений. • Статью можно прочитать тут, а код найти здесь 😉
А вот тут ребята из моей предыдущей команды запускают политику манипуляции. Навык на видео самый простой pick-place, но выглядит достаточно робастно, плюс на антропоморфе — в России подобного никто не делает толком. Робот вышел в паблик, теперь можно официально рассказывать чем занимался год назад)
Залетели с ребятами на конференцию AIJ
видео или голосовое, без подписи
видео или голосовое, без подписи
Рассказали про нашу статью GSplatLoc - собственно, ради этого в первую очередь сюда и приехал. Сегодня конференция завершилась, можно ехать домой 🙂 Все очень понравилось, организация на очень хорошем уровне, а Ханчжоу - классный город!
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи