- Последний пост
- 14 авг.
- Последнее чтение
- 14 авг.
- Постов за неделю
- 1
- Всего постов
- 41
- Тип
- открытый
- Язык
- русский
- В каталоге с
- 13 авг.
- 1/24сутки в ленте
- 245
- 1/48двое суток
- 280
- 1/72трое суток
- 302
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
видео или голосовое, без подписи
Запись и презентация моего выступления с AI Dev Meetup: Youtube VK
В комментах к этому посту можно задавать вопросы после митапа.
Меня внезапно зазвали на AI Dev Meetup поговорить про локальных ИИ-агентов и потыкать их на практике. Поговорим, кому и зачем это может быть нужно, посмотрим бесплатные альтернативы и попробуем их на живой задаче из нашего декомпилятора. Пойду куплю себе микрофон по такому случаю. PS: Интересно, что телега не хочет показывать preview ссылки с таймпада, а мах показывает. PPS: Если вы уже опытный, так сказать, вайб-кодер, то вряд ли услышите что-то новое для себя. Встреча ориентирована на новичков.
Вышел документальный фильм об истории C++: https://youtu.be/lI7tMxzSJ7w
Пост о том, что такое CUDA Tile, который зарелизили в CUDA 13.3: https://developer.nvidia.com/blog/develop-high-performance-gpu-kernels-in-cpp-with-nvidia-cuda-tile/ Если кратко, то они ввели новый вид кернелов: __tile_global__, в которых вообще не указываешь работу для отдельных потоков, а пишешь кода для обработки на уровне тайлов, а компилятор уже сам определяет, как там потоки работают между собой. Для этого есть пространство имён cuda::tiles. В нём живут: tensor_span (аналог std::mdspan), его растаскивают на весь буфер при помощи extents{m, n}, и обёртка partition_view, которая нарезает буфер на те самые тайлы при помощи функции load(). Получается, примерно, такой кернел для сложения массивов: #include "cuda_tile.h" __tile_global__ void vectorAdd(float* a, float* b, float* out, size_t n) { /* set up the namespace */ namespace ct = cuda::tiles; using namespace ct::literals; /* attach shape to raw pointers */ auto aSpan = ct::tensor_span{a, ct::extents{n}}; auto bSpan = ct::tensor_span{b, ct::extents{n}}; auto oSpan = ct::tensor_span{out, ct::extents{n}}; /* partition each span into tiles of size 8 */ auto aView = ct::partition_view{aSpan, ct::shape{8_ic}}; auto bView = ct::partition_view{bSpan, ct::shape{8_ic}}; auto oView = ct::partition_view{oSpan, ct::shape{8_ic}}; /* load the a and b tiles from global memory */ int bx = ct::bid().x; auto aTile = aView.load(bx); // load bx-th tile auto bTile = bView.load(bx); /* add the two tiles together, elementwise */ auto oTile = aTile + bTile; /* store the result tile to the output partition. */ oView.store(oTile, bx); } Конкретно для такой задачи он намного сложнее обычного кода, но в нём не надо думать о переполнении памяти, гонках и так далее. #CUDA #GPU #GPGPU
В CUDA 13.3 Добавили нативную поддержку питона. Надеюсь, теперь, наконец, не будет отваливаться Nsight как это обычно бывает с pycuda 🎮 CUDA 13.3 получился очень насыщенным: * Поддержка Python; * Релиз CUDA Tile C++; * CompileIQ — фреймворк автотюна кернелов, обещают, что ускорили некоторые аж на 15%; * Полная поддержка С++ 23. https://developer.nvidia.com/blog/nvidia-cuda-13-3-enhances-gpu-development-with-tile-programming-in-c-compiler-autotuning-and-python-updates/ #CUDA #GPGPU #Python
Константин Владимиров выложил лекцию по GPGPU и SYCL на английском языке: https://youtu.be/Ebj21eXDRDY На русском языке есть прошлых лет (они отличаются по содержанию, поэтому несколько): - 2025 года: https://rutube.ru/video/90021891c6dfc628a4ca2a1824c8f429/ - 2023 года: https://youtu.be/-aE1hD9OWRk?si=xL5T7weQ4PgkBC4D - 2022 года: https://rutube.ru/video/614a764b29fc3f9309a0ea12d9f61315/ #GPU #GPGPU
Alibaba выпустила пост про новую модель Qwen 3.7-Max: https://qwen.ai/blog?id=qwen3.7 Интересно посмотреть на раздел "Self-Evolving in the Wild". В нём они хвастаются, что с помощью этой модели ускорили референсную реализацию multi-head attention в SGLang в десять раз. Там же перечислены основные оптимизации, до которых додумалась нейронка.
Good news, everyone! Инженеры компании YADRO сегодня развернули среду для воркшопа про ускорение LLM, и теперь можно на тестовый прогон записаться и без доступа к железу, а подключиться к их серверу. Так что если кто хотел записаться, но не имел железа, теперь можно. Кроме того, это шанс бесплатно потрогать серверную GPU Nvidia H100. Кстати, мы завели чаты в телеге: 🥹: тут. 🪵: тут.
Продолжаем готовиться к конференции C++ Russia 2026. У нас запланированы воркшопы и мастер-классы, и мы сейчас приглашаем желающих на тестовые прогоны двух из них. Тестовые прогоны пройдут 12 мая в 19:00. 1. Ускоряем LLM с помощью своего расширения для PyTorch. 📃 Форма для записи. Важно. Prerequisites: * Во время тестового прогона мы не предоставляем доступ к железу. От участников требуется иметь доступ к машине, у которой есть видеокарта Nvidia, совместимая с CUDA 13 и установлен Docker. * Требования к участникам: умение писать код на C++, собирать его с CMake и умение понимать Python. Умение программировать видеокарты НЕ требуется. 2. Кросс-разработка в режиме live Linux-драйвера символьного дисплея LCD1602. 📃 Форма для записи. На этот мастер-класс каких-то особых требований к участникам нет.
С Праздником Великой Победы! 🎆
Замними апрельскими деньками посетил для перенятия опыта конференцию Heisenbug, которая всё больше начинает походить на тусовку ML-щиков чем тестировщиков (: Там был воркшоп по построению RAG. Вот на него небольшой отзыв: Вообще говоря, я (и ещё несколько человек) предполагали, что раз это воркшоп, то мы будем его (RAG) делать руками. Получилось что-то вроде длинного интерактивного доклада с вопросами в любой момент по ходу рассказа. Сам воркшоп не требовал спецзнаний, поэтому было много базовых (и про векторную базу данных тоже) вопросов, поэтому под конец на сложные вопросы времени не осталось. Однако я ухватил докладчика и допрашивал весь обед. Если не считать несовпадения ожиданий, то рассказ получился вполне годным, особенно для тех, кто никогда не занимался RAG. Рассказали и показали на примере, как с нуля сделать RAG по современным отраслевым стандартам и best practices. Презентацию вполне можно использовать как чек-лист, не забыл ли чего перед выкатыванием в прод, и как справочник (но тут надо понимать, что месяцев через 6 он наверняка устареет хотя бы частично и будет продолжать стремительное устаревание) К сожалению, запись не делали (я так понял, что они планировали написание кода, но передумали), поэтому не получится пересмотреть, но презентация осталась. Если вы, как я, сделали уже свой первый RAG, но не являетесь в этом профи, то и презентации будет достаточно.
Выложили лекцию в ПОМИ про архитектуру Huawei Ascend: 📹: https://youtu.be/fRqOFrJ36Kc?si=ZNE3BhIjjxPEmFqY #симпозиум
Привет, друзья! Новый выпуск готов! В гостях Николай Полярный - технический директор Agisoft: разрабатывает алгоритмы компьютерного зрения для Metashape - программы, которая строит 3D-модель объекта или даже целого города по фотографиям. Автор курса по фотограмметрии и курса по вычислениям на GPU. Преподаёт программирование в школе. Что такое фотограмметрия? Зачем нужны цифровые двойники деревьев? Используют ли до сих пор классические ML-алгоритмы в CV или всё захватили нейросети? Зачем алгоритмам машинного обучения нужен зазеркальный мир? Почему в научных статьях критически важен буквально каждый абзац и как это связано с проблемой воспроизводимости исследований? Как стать экспертом по профилированию? Как спидранят разработчики? Как не потеряться в бесконечном бэклоге? Как LLM-ки помогают готовить учебные материалы в Сириусе? Много ли бюрократии в современных школах? Какие есть сложности с проектными подходами в обучении? Обо всём этом в выпуске! https://mlpodcast.mave.digital/ep-79
Привет! Я на днях делал доклад "Актуальность и области применения языка С++ в современном ML" на конференции "Современные технологии в теории и практике программирования" в Санкт-Петербургском Политехническом Университете. К сожалению записи с мероприятия нет, но я делюсь видео с подготовки доклада. Надеюсь кому-то будет полезно. https://rutube.ru/video/bc863eb9180b8cf67d118bb4b2ab1cb7/
Продолжаем рассказывать про конференцию C++ Russia Помимо GPGPU, на ней также представлен геймдев, который, вероятно, тоже вам интересен. Доклад от программиста Elverils (разработчиков порта на macOS Baldur's Gate III и других игр) Платона Иофинова: Slang: конвертируем тысячи шейдеров для кроссплатформенного рендерера Доклад про интересный шейдерный язык Slang, разработанный Nvidia для максимально возможной кроссплатформенности между GPU-платформами. Доклад от Александра Кухаренко, графического программиста, поработавшего в различных игровых компаниях, включая Wargaming: Visual Studio как фронтенд для графического движка Интересная работа по нестандартному применению Microsoft Visual Studio. Доклад от программистов «Леста игры»: Владислава Гордиенко, Филиппа Белозёрова: Игровой сетевой КОД, или Как приготовить UDP Они предложили несколько вариантов доклада, и у нас был очень непростой выбор. В итоге мы остановились на докладе про сетевой код, возможно, самую сложную часть сетевых игр. Это, конечно, не относится к графике, но всё равно интересно, как в сейчас делают синхронизацию игрового мира с минимально возможной задержкой. Доклад от программиста BlackHubGames (разработчиков игры Black Russia — это такой GTA Online в России) Ильи Лебедева: Защита игрового клиента на C++: контент, обфускация кода и базовые античит-подходы Тоже не про графику, но лично мне интересно про механизмы защиты игр от читеров. #симпозиум #gamedev #shaders
Лекция в ПОМИ про архитектуру Huawei Ascend Адрес: г. Санкт-Петербург, наб. реки Фонтанки, 27 https://csspace.io/open-lecture/2026-ascend Кто пойдёт? #симпозиум
Я вхожу в ПК C++ Russia уже несколько сезонов, и хочу рассказать про нововведения этого сезона. В этот раз решили объединить "под одной крышей" тематики сразу трёх конференций С++, sysconf и Hydra (конференция про многопоточное и распределённое программирование), так как sysconf понравился многим, но в этом году его не получилось провести, а ещё старожилы с теплотой вспоминают тот год, когда C++ Russia и Hydra встретились на одной площадке. Мы и раньше вылезали за рамки С++, а в этом году будем вылезать ещё больше. А теперь перейдём к обсуждению той части конфы, что наиболее интересна GPU-сообществу. Во-первых, это воркшоп «Ускоряем LLM с помощью своего расширения для PyTorch». Ведущие: Кирилл Колодяжный, автор канала Adept (там Кирилл рассказывает про разработку ML-фреймворка Adept, аналога PyTorch, подписывайтесь очень интересно, кстати) и мы, редакция канала GPGPU_RU, Михаил Лукин и Тимур Магомедов. А также доклады: «Фотограмметрия: построение 3D-двойника города при 16 ГБ памяти» от Николая Полярного, известного своими курсами по программированию на видеокартах и автора канала Опушка единорогов (тоже подписывайтесь!). В докладе будет рассказан алгоритм реконструкции 3D-объектов, придуманный самим Николаем и опубликованный на ICCV 2021, и который Николай реализовал у себя на работе, включая интересные решения для работы на GPU с данными, не помещающимися в память. «Эффективный запуск compute-шейдеров в Adept» от Кирилла Колодяжного. В этом докладе Кирилл расскажет, как он продолжает оптимизировать упомянутый выше фреймворк Adept на Vulkan. На данный момент Vulkan Compute поддерживается более широким спектром устройств, чем даже OpenCL. Например, от поддержки OpenCL отказалась одна фруктовая компания, а многие производители мобильных телефонов и планшетов ленятся добавлять его поддержку даже несмотря на то, что у производителя процессора она есть. А Vulkan является основной графической платформой, поэтому его не добавить в своё устройство нельзя. Также будет рассказано про важные отличия Vulkan Compute от CUDA и OpenCL. Ну и бенчмарки и сравнение с PyTorch на CUDA тоже будут. #симпозиум #vulkan #gpgpu #opencl
С Днём Космонавтики, друзья!