tgindex
Ruslan Rakhimov × world models × vlm agents × 3d

Ruslan Rakhimov × world models × vlm agents × 3d

Статистика
@algaruslanрусский
Последний пост
2 июл.
Последнее чтение
15 авг.
Постов за неделю
0
Всего постов
21
Тип
открытый
Язык
русский
В каталоге с
12 авг.
Подписчики
87
0 за 3 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
417
20 постов
Вовлечённость
479,3%
к подписчикам
Постов в день
0,0
всего 21
Упоминаний
2
каналов
Охват размещения
оценка
1/24сутки в ленте
1/48двое суток
1/72трое суток

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • Накатывал фиксы, лидерборд обнулен, но зато Т теперь подгонит подарки первым топ 3 лидерборда

  • #6 из 8, лосс 4.9e-6 и ни одного NaN 😎

  • 1 июл.8871617

    18 июля буду рассказывать про модели мира и что с командой сделали в этом направлении, приходите! Будут также и другие доклады, регистрация и программа по ссылке: https://mlconf.t-bank.ai

  • 18 июля буду рассказывать про модели мира и что с командой сделали в этом направлении, приходите! Будут также и другие доклады, регистрация и программа по ссылке: https://mlconf.t-bank.ai

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • 2 июн.267223из zheltyi_ai

    Съездили в 🔤🔤🔤🔤🔤🔤 на AAMAS 2026, где у нас был oral с работой Enhancing Vision-Language Model Training with Reinforcement Learning in Synthetic Worlds for Real-World Success. В статье мы обучаем VLM-агентов через RL в дешевых синтетических средах: MiniWorld, Gym-Cards, ALFWorld и WebShop. Основная идея — если хотим, чтобы модель не просто красиво описывала картинку, а умела смотреть на состояние мира и делать последовательность действий, то ей нужно дать возможность потренироваться в интерактивных окружениях. Для этого предложили VL-DAC: простой RL-метод, где PPO применяется к action-токенам, а value учится один раз на шаг среды. В итоге убираем хрупкие коэффициенты между thought/action токенами, replay buffers и прочие места, где обычно хочется немного поплакать во время обучения VLM через RL. После обучения в одном дешевом симуляторе модель переносит навыки на реальные бенчмарки: +50% relative на BALROG, +5% на самой сложной части VSI-Bench и +2% на VisualWebBench, при этом не ломая обычное понимание изображений. • Статью можно прочитать тут, а код найти здесь 😉

  • А вот тут ребята из моей предыдущей команды запускают политику манипуляции. Навык на видео самый простой pick-place, но выглядит достаточно робастно, плюс на антропоморфе — в России подобного никто не делает толком. Робот вышел в паблик, теперь можно официально рассказывать чем занимался год назад)

  • Залетели с ребятами на конференцию AIJ

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • Рассказали про нашу статью GSplatLoc - собственно, ради этого в первую очередь сюда и приехал. Сегодня конференция завершилась, можно ехать домой 🙂 Все очень понравилось, организация на очень хорошем уровне, а Ханчжоу - классный город!

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

Ruslan Rakhimov × world models × vlm agents × 3d — tgindex