Dendi Math&AI
СтатистикаКанал Дениса Димитрова о математике и искусственном интеллекте. В основном разные интересные и актуальные новости и мысли
- Последний пост
- 6 авг.
- Последнее чтение
- 00:45
- Постов за неделю
- 0
- Всего постов
- 20
- Тип
- открытый
- Язык
- русский
- Категория
- Искусство
- В каталоге с
- 13 авг.
- 1/24сутки в ленте
- 422
- 1/48двое суток
- 483
- 1/72трое суток
- 521
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Курс по Visual GenAI от Yandex Research и ШАД Авторы CV Time не только пишут обзоры статей о компьютерном зрении, но и создают обучающие курсы. Сегодня делимся курсом ШАДа «Генеративные модели в компьютерном зрении», который ведёт Дмитрий Баранчук, руководитель группы GenAI в Yandex Research, вместе с праймовой командой исследователей в этой области. Будет полезно тем, у кого есть базовые знания по генеративкам и желание разобраться глубже: • в теории диффузионных моделей, эффективных методах их обучения и семплирования; • в новых гибридных моделях на основе диффузии для генерации изображений, видео и 3D. У курса есть открытый GitHub-репозиторий, где можно найти слайды, записи лекций и семинаров, а также домашние задания. CV Time
В этом году я организую секцию GenCV в рамках DataFest 2026. Будут интересные доклады: о моделях генерации изображений, видео, 3D, о моделях мира, о VAE для токенизации мультимодального контента. Обсудим разные подходы при создании такого рода моделей (обязательно…
В этом году я организую секцию GenCV в рамках DataFest 2026. Будут интересные доклады: о моделях генерации изображений, видео, 3D, о моделях мира, о VAE для токенизации мультимодального контента. Обсудим разные подходы при создании такого рода моделей (обязательно…
В этом году я организую секцию GenCV в рамках DataFest 2026. Будут интересные доклады: о моделях генерации изображений, видео, 3D, о моделях мира, о VAE для токенизации мультимодального контента. Обсудим разные подходы при создании такого рода моделей (обязательно — омнимодальность 😉), поговорим про инженерные сложности pre-train, alignment (SFT, RL) и про то, как добиться real time генерации видео, затронем нюансы сбора и фильтрации данных. Конечно, обсудим применения моделей генерации изображений/видео и их потенциал в настоящем и будущем. В общем, будет интересно и полезно! 💪 Сегодня последний день, когда можно подать доклад. Так что если есть релевантные темы, скорее подавайте заявку, и буду рад вас видеть. Или просто приходите послушать доклады и понетворкать
А вы знали, что методы генерации видео можно использовать для прогноза погоды? Наша команда разработала Marchuk — первую в России генеративную модель для прогнозирования климатических рисков. Мы взяли диффузионные трансформеры (которые обычно генерируют изображения и видео) и научили их предсказывать погоду. И вот что получилось: ✔️Субсезонный диапазон: Marchuk позволяет строить прогнозы на 15-30 дней вперёд ✔️Компактная модель: имея всего 276M параметров, она показывает сопостовимое качество с 1,6B аналогом ✔️Доступность: Код и веса модели в открытом доступе, а запустить ее можно всего на одной видеокарте или в Colab 💡 Имя модели — дань уважения математику Гурию Ивановичу Марчуку, заложившему основы численного моделирования климатических процессов. 👇 Читайте подробности о разработке по ссылкам: ArXiv | Project Page | GitHub | Colab | HF
Приглашаем на пятый Большой Семинар AIRI, который пройдёт 16 апреля в 17:00 ⤵️ Хотим поделиться с вами, что у Института AIRI тоже юбилей — в этому году нам исполняется пять лет. Готовимся праздновать ❤️ Докладчиком выступит доктор экономических наук, декан и профессор экономического факультета МГУ им. М. В. Ломоносова, заведующий кафедрой прикладной институциональной экономики Александр Александрович Аузан. Тема выступления: «Новая гипотеза образования в эру ИИ». Модератор Большого Семинара AIRI — доктор физико-математических наук, профессор РАН, генеральный директор AIRI, декан факультета искусственного интеллекта МГУ Иван Оселедец. 📌Подробное описание лекции и регистрация на очный формат по ссылке. Трансляция пройдёт в VK Видео и на YouTube. Сбор гостей начинается с 16:30. До встречи!
видео или голосовое, без подписи
⚡️Коллеги из Центра Робототехники Сбера на этой неделе опубликовали техрепорт по Green-VLA. Это 4B staged vision–language–action (VLA) модель для generalist-роботов и, в первую очередь, конечно же для робота Грина 😎 Его как раз и делают ребята — они представляли Грина и довольно подробно про него рассказывали (особенно в части железа и контрола) на AI Journey в конце ноября 2025 В статье подробно разобрано, что именно помогает VLA моделям не разваливаться в реальном мире и быть устойчивыми к изменению сред и робот-платформ. На самом деле, это всё очень сложные задачи (например, картины по разным причинам рисовать «проще» 😄 — в смысле, картинки генерировать). У человека способности уверенно оперировать в физическом мире, в том числе подстраиваться к незнакомым средам, выполнять там сложные задачи, в конце концов пространственно ризонить, развивались миллионы лет в процессе эволюции: средний человек, например, почти не приложит никаких усилий для того, чтобы «в совершенно незнакомой квартире (например, у новых друзей) найти кухню и заварить там чашечку кофе». Стив Возняк к слову предложил именно эту задачу как тест на human-level embodied AGI (неспроста 💯) В случае роботов (и, конкрентно, VLA, которые действиями роботов управляют) этого прогресса исследователям фактически надо добиваться «с нуля» (на самом деле, не совсем так — ведь есть фундаментальные модели почти на все случае жизни: языковые, мультимодальные, модели генерации изображений и видео) В общем, в процессе исследований коллеги из Центра Робототехники: 🔘разработали пятиступенчатый пайплайн обучения (он даёт роботу возможность надёжно выполнять разные задачи в реальном мире): L0 (тут берётся базовая обученная VLM-ка) → L1 (дополнительная стадия дообучения для лучшего понимания моделью физики мира, прокачивание пространственного ризонинга) → R0 (ещё одна стадия претрейна на 3,000+ часах видео с широкого класса роботов) → R1 (тюн уже под конкретного робота) → R2 (RL-based policy alignment — даёт дополнительную робастность при выполнении роботом сложных инструкций) 🔘показали, как эффективно выучивать и использовать единое action-пространство для разных робот-платформ (необходимо, чтобы перенос между эмбодиментами был системным и масштабируемым); 🔘показали SOTA результаты на разных бенчмарках: Simpler/BRIDGE WidowX, CALVIN ABC→D и на реальном Green Humanoid 🧩 Из планов — мы с ребятами уже проводим совместную работу по генерации синтетики с помощью семейства моделей Kandinsky, чтобы ещё сильнее увеличить generalization Green-VLA и расширить покрытие «редких» сценариев (которые по естественным причинам сложно и дорого собирать в реальном мире) По хорошей традиции ребята залетели в топ Daily Papers на HF 🤗 Они уже давно топ-1 среди статьей дня и недели и топ-2 в рейтинге месяца. Считаю, что надо помочь ребятам стать топ-1 по месяцу — работа получилась очень хорошая. Если вам техрепорт тоже показался полезным, обязательно ставьте upvote ⬆️ И ещё раз все полезные ссылки: 👉 Upvote ставить тут 👉 ArXiv 👉 Project Page 👉 GitHub
видео или голосовое, без подписи
🥳 Мы докатили в text-to-video арену две наши последние модели генерации видео Kandinsky 5.0 Video Lite и Pro ⚡️Результаты следующие: 🔘Pro версия является ТОП-1 опенсорсом в мире (см. модели с лицензиями MIT, Apache 2.0 в лидерборде) 🔘Lite версия лучше первой версии Sora (не супердостижение, но у Lite всего 2B параметров) 🔘Лучше нас (Pro) только Google (Veo 3.1, Veo 3), OpenAI (Sora 2), Alibaba (Wan 2.5), KlingAI (Kling 2.5, 2.6) — объективно самые сильные модели генерации видео в мире на текущий момент; в паритете с нами Luma AI (Ray 3), MiniMax (Hailuo 2.3) — отрыв по ELO максимум 3 балла, при 95% доверительном интервале оценивания +-21 балла 🔘В целом стоит отметить, что для российских генеративных моделей выход на международную арену — довольно уникальное событие 🚀 Полезные ссылки: 🔘Посмотреть весь лидерборд можно вот тут: lmarena 🔘Твиттер организаторов арены: X lmarena.ai 🔘Почитать подробнее про Kandinsky 5.0: пост, техрепорт, 🔘Потестить Kandinsky 5.0: github и hf @dendi_math_ai
⚡Салют, Гига! — уже сегодня Обещал вернуться с программой — вот она. Моя команда приготовила на эту конференцию большое количество материалов в формате докладов, воркшопов, постеров и стендов. Фокус — на синтез мультимедийного контента (изображений, видео, синхронного аудио) с помощью новых моделей Kandinsky. Успеем рассказать почти всё (и продемонстрировать это на практике) Поговорим: 🔘об архитектуре, инфраструктуре и деталях обучения нового семейства моделей генерации изображений и видео Kandinsky-5: как этапа pre-train, так и alignment (SFT и RL); 🔘о способах дообучения Kandinsky-5 для персонализации и добавления новых сущностей, а также для более качественного управления камерой; 🔘о том, как мы готовили датасет для pre-train и alignment моделей Kandinsky-5; 🔘об ускорении диффузионных моделей в разы — с помощью диффузионной дистилляции; 🔘о добавлении синхронного аудио к видео при генерации; 🔘о разработке и применении метода разреженного внимания NABLA (Neighborhood Adaptive Block-Level Attention) для ускорения инференса и обучения моделей Kandinsky-5; 🔘о K-VAE, которые нужны для кодирования и декодирования изображений и видео и которые крайне необходимы для обучения core-модели; 🔘даже о моделях мира, которые строятся поверх моделей генерации видео; 🔘и, конечно, о будущем моделей генерации изображений и видео, вызовах, которые стоят перед их разработчиками, и о некоторых их применениях Кроме того, коллеги из GigaChat и GigaData подготовили огромное количество очень интересных выступлений и докладов про разработку и обучение семейства языковых моделей GigaChat, а также про данные, которые для этого необходимы. А организаторы уложили это в концепцию целого ГигаГорода В общем, будет очень насыщенно, интересно и полезно! Участие бесплатное, но нужна регистрация. К сожалению, оффлайн регистрация уже закрылась, но ещё можно запланировать и подключиться онлайн (мой собственный доклад в 14:00) Увидимся! 🚀
Кстати говоря, за последнюю неделю наш техрепорт сначала взял топ-1 за день, потом за неделю, а сейчас уже и за месяц (ноябрь) в рейтинге Daily Papers на HF 🤗, причём с хорошим отрывом. Осталось продержаться 3 дня :)
Всем привет! В дополнение к нашему подробному техрепорту по линейке моделей Kandinsky 5.0 на английском сегодня мы выпустили статью на Хабр на русском 🔥 Там найдёте ещё больше подробностей разработки наших моделей, примеров их использования и разных применений! 👉 Ещё раз ссылка на статью на Хабр 👉 Ссылка на техрепорт @dendi_math_ai
10 декабря будем с ребятами рассказывать о том, что сделали за этот год по всем направлениям в рамках разработки моделей Kandinsky. Будет много всего интересного, регистрируйтесь и приходите @dendi_math_ai
Dendi Math&AI pinned a photo
видео или голосовое, без подписи
⚡Мы также выложили в открытый доступ наши новые вариационные автоэнкодеры K-VAE 1.0 ❓О чём речь Генеративные модели, такие как, например, Kandinsky 5.0, синтезируют медиаконтент в «скрытом» пространстве, нечитаемом для человеческого глаза. Это необходимо для более эффективного, быстрого и менее требовательного к памяти обучения и применения такого рода моделей. Мы выпускаем собственные, обученные с нуля автоэнкодеры K-VAE 1.0 для изображений (2D) и видео (3D), которые преобразуют медиа в «скрытые» представления и обратно K-VAE 1.0 2D работает с изображениями (сжимая в 8x8, то есть в 8 раз по каждой из пространственных осей), а K-VAE 1.0 3D — с видео (сжимая в 4x8x8, то есть в 4 по временной оси и в 8 по каждой из пространственных). Модели превосходят соответствующие лучшие open-source альтернативы (FLUX VAE, Wan VAE, HunyaunVideo VAE) на открытых датасетах 🚀 Доступность и информация: 🔘 Лицензия поддерживает коммерческое использование (MIT) 🔘 Все материалы можно найти на GitHub и HuggingFace 🔘 Почитать подробнее можно на Хабр @dendi_math_ai
видео или голосовое, без подписи
🚀 Мы с командой открываем всю линейку генеративных моделей Kandinsky 5.0! В сентябре мы выложили в open source Kandinsky 5.0 Video Lite, получили множество положительных отзывов и полезной обратной связи, большое спасибо всем! Сегодня мы открываем всю линейку: как Video, так и Image модели. Дальше расскажу все подробности, но можно сначала сходить попробовать: модели доступны всем на открытых поверхностях ГигаЧат: Telegram, Max и giga.chat 🎬 Video Pro – мощные Text-to-Video и Image-to-Video – лучшие в мире open source модели, превосходящие по качеству Wan 2.2 A14B и работающие наравне с Veo 3 от Google по визуалу и динамике (в HD) 🖼 Image Lite – универсальные Text-to-Image и Image Editing модели c 6B параметров, которые нативно поддерживают промты на русском языке, знают культурный код и генерируют картинки с кириллическим текстом. Значительно превосходит FLUX.1 [dev] в задаче генерации изображений и работают на одном уровне с FLUX.1 Kontext [dev] в их редактировании В открытом доступе: четыре версии Image Lite и пять версий Video Pro для разных задач (для генерации 5 сек и 10 сек видео, разрешение — SD и HD). Доступны как SFT-версии с максимальным качеством, так и Pretrain, для исследователей и дообучения 🔧 Как мы достигли этого (подробнее в нашем большом техрепорте): 🔘 Большой Pretrain-датасет 520 млн изображений и 250 млн видео-сцен 🔘 Фокус на SFT: художники и дизайнеры тщательно выбирали материалы с безупречной композицией, стилем и визуальным качеством 🔘 Разработали метод NABLA для стабильной 10-секундной генерации в HD-разрешении 🔘 Использовали архитектуру Kandinsky-DiT с flow matching 🚀 Доступность и информация: 🔘 Лицензия поддерживает коммерческое использование (MIT) 🔘 Все материалы можно найти на GitHub, HuggingFace и GitVerse 🔘 Техрепорт, кстати, уже сейчас #1 в Daily Papers, но ваша поддержка поможет укрепить эту позицию :) @dendi_math_ai
⚡️У нашей конференции AI Journey в этом году появился специальный трек для всех, кто хочет послушать толковые технические доклады, узнать о разных реализуемых AI-кейсах и просто провести время с пользой, пообщавшись с интересными людьми. Знакомьтесь — AIJ Deep Dive! Трек пройдет 19 ноября (наука) и 20 ноября (бизнес) на площадке штаб-квартиры Сбера на Кутузовском проспекте — регистрация для очного участия уже открыта! Программа будет соответствовать тематике дней. Поэтому если хотите попытать спикеров (меня, в частности) техническими вопросами, узнать разные нюансы текущих исследований и разработок — это можно будет сделать 19 ноября. А если вам больше интересны реальные кейы внедрения AI в бизнес и разные практические результаты — приходите 20 ноября При этом оба дня будут работать постер-сессия с разными научными статьями (уровня A*/ A) и выставка AI-решений. И, конечно, будет крутой нетворкинг (но это во многом будет зависеть от вас) Кстати говоря, мы с командой с 2020 года готовим разные соревнения для контеста, который проходит в рамках AI Journey: например, Digital Пётр или серию FusionBrain Challenge (1.0, 2.0, 3.0, 4.0). В этом году можно поучаствовать в не менее интересных соревнениях (у которых помимо всего прочего еще и хороший призовой фонд) В общем, регистрируйтесь, приходите и участвуйте! Увидимся! @dendi_math_ai