tgindex
Awesome DL
@awesome_dlБлогирусский

Авторский канал: @anvilarth Boost: https://t.me/awesome_dl?boost

Последний пост
31 июл.
Последнее чтение
07:52
Постов за неделю
0
Всего постов
20
Тип
открытый
Язык
русский
Категория
Блоги
В каталоге с
13 авг.
Подписчики
867
0 за 2 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
1 110
20 постов
Вовлечённость
128,0%
к подписчикам
Постов в день
0,0
всего 20
Упоминаний
1
каналов
Охват размещения
оценка
1/24сутки в ленте
574
1/48двое суток
657
1/72трое суток
709

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • 31 июл.3461417

    Age of Autoresearch Был обычный вечер, и мне было откровенно лень гонять гипотезы руками. Я описал pipeline текстом, попросил Gemini судить результат каждой попытки и лёг спать. Утром в логе было 40 проверенных гипотез. Потом выяснилось, что у этого уже есть имя — autoresearch — и пара громких прецедентов до меня. написание кода с ассистентом → делегирование подзадач → цикл, который перебирает сам Написал эссе о том, что этот сдвиг делает с работой человека. Рецептов там нет, у меня их и нет — скорее попытка разобраться, что остаётся, когда знание «как устроена задача» перестаёт быть самой работой. 👉 /autoresearch.html Заодно сделал блог agent-friendly: markdown-версия поста лежит на /autoresearch.md, весь сайт для агентов — /llms.txt. Так что можно просто кинуть ссылку в своего любимого агента и попросить пересказать. Enjoy!

  • Слухи о том, как китайцы дистиллировали frontier и как claude стрельнул себе в ногу через защиту от инъекций

  • 16 июн.9461621

    Новая эра интерфейсов Мне давно хочется создавать системы, которые живут и адаптируются как человек — прям как живое существо рядом с тобой. Чтобы сайт подстраивался лично под тебя, а не был статичной менюшкой для всех сразу. Меня всегда напрягало, что сайты вообще не адаптируются под человека: ну есть a/b по ui/ux, но концептуально сайт один и тот же для всех. И тут в апреле вижу в твиттере демку flipbook.page — минимальное mvp, которое показало, что то, о чём я мечтаю, реально. Сайт полностью динамический, ни одной заранее написанной страницы. Кликаешь на объект — и новая страница генерится прямо сейчас, под твоим кликом. Идёшь дальше — мир достраивается под ногами и адаптируется под тебя. Я офигел. Я хотел персонализированные динамичные сайты — а увидев, как это реализовано, понял: будущее за этим куда круче, чем я думал. Сайт же это просто интерфейс поверх контекста, который человек хочет тебе донести, — и он может собираться прямо под тебя. Покупаешь джин — тебе сразу показывают, как лучше намешать именно этот джин-тоник. Читаешь разбор FSDP или ring attention — видишь таблички и схемы, как всё работает. Ровно то, что зайдёт тебе. И если генерить это в реальном времени — а что если твой телефон вообще не набор приложений, а персональный стриминг пикселей? Любое нажатие динамично, тебе не нужен ни текстовый ai, ни генерация приложений — оно само понимает, как должно выглядеть любое приложение, которое ты хочешь. Разработчики приложений становятся не нужны — не потому что их заменил ai, а потому что приложение это просто поток пикселей. Останутся только те, кто пилит сами модели. И вот это самое крутое — что такое уже возможно, и это куда ближе, чем кажется. Реализуется оно через realtime-видеогенерацию — я как раз прикидывал, когда она наступит: на компах это на горизонте 2-3 лет, на телефонах подольше. А пришёл я к этой мысли, когда готовил доклад на DataFest в Белграде про realtime video generation — го смотреть. Может, и у вас появятся идеи. Enjoy!

  • 13 мая1 1005011

    Krea-2: taste is what matters 4 месяца назад я перешёл в Krea и вчера мы выкатили модель Krea-2 и я мега рад этим поделиться. Меня давно бесило что большинство image-моделей, тот же ChatGPT Image или Nano Banana, оптимизированы под среднюю красивую картинку — генеришь 4 варианта одного промпта и по факту получаешь один и тот же концепт просто под разными углами. Это убивает разнообразие стилей и прям не даёт выразить своё видение, каждая генерация тянет к центру, к усреднённому. С Krea 2 мы реально занялись разнообразием — один и тот же промпт даёт реально разные концепты и эстетики. И ещё по верх этого сделали своё midjourney внутри Krea: reference-генерация и персональные мудборды — закидываешь свои референсы, собираешь мудборд, и модель тянет в твою сторону, а не к среднему. Получилось gucci. Я как раз работал над одной из лучших штук в продукте — системой reference-генерации и мудбордами. И кстати, по независимому бенчмарку K2 топ-2 по следованию стилям, впереди только gpt-image-2.0 — при размере нашей команды и ресурсах это просто офигенный результат. А ещё за эти 4 месяца я сам дофига расширил своё видение стилей и красоты, прям сильно. Чего не сделаешь для крутого результата. Короче, рад что вышло круто, смотреть тут → krea.ai/krea-2

  • 31 мар.1 1402031

    История о том, как штука для рисования треугольников стала самым важным чипом на планете Мы все каждый день используем GPU, но мало кто копался в том, какая история за ними стоит. Я решил разобраться с нуля — и больше всего меня зацепила красота инженерных решений: каждое следующее — прямое следствие предыдущего. отрисовка треугольников → параллелизм → SIMD → unified cores → CUDA → ML → Tensor Cores Ни одно звено не случайно. Когда видишь эту цепочку целиком — понимаешь, почему GPU устроен именно так. Лонгрид на ~20 минут с интерактивными демками. → anvilarth.github.io/gpu-story.html Enjoy!

  • 15 мар.1 1941220

    Когда мы получим realtime видео? Считаю от first principles (Лонгрид) Мне всегда было интересно предсказывать будущее — на знании будущего можно заработать деньги, лучше определить путь своего развития. А как это делать? Ответ у меня начал зарождаться в 2023, во время прослушивания интервью Хинтона о будущем искусственного интеллекта. Он упомянул, что скоро LLM будут инференситься на отдельных устройствах (смотря из 2026 так просто выглядит). Для меня это было непонятно — тогда я не задумывался об устройстве памяти, ограничениях вычислений. Я знал только, что есть A100/H100. А оказывается, создание специализированных чипов для инференса конкретной модели — один из самых эффективных методов ускорения, например Taalas, который с оговорками, но выдаёт 16k токенов в секунду, за счёт отсутствия универсальности CUDA и оптимизированного memory bandwidth И тут я понял: глубинное знание базовых нюансов — скорость вычислений устройства, memory bandwidth — это ключ к пониманию того, где лимиты технологии и какие AI-продукты мы можем получить в ближайшие 5-10 лет (ну если AGI не наступит раньше). Поэтому я решил сделать расчёты для близкой мне технологии — видеогенерации, а именно realtime видеогенерации: какой сейчас статус, что мы можем получить за счёт ускорения GPU и когда это дойдёт до мобильных устройств. Сами расчёты — в лонгриде Интерактивно потыкать и посмотреть как меняться будут предсказания можно — на сайте Лонгрид Демо Enjoy!

  • 25 янв.1 170838

    How to build your search engine? Понимание бэкенда + архитектуры помогает делать ваш вайбкод one-shot готовым решением. Поэтому я люблю читать блоги про о том, как создается архитектура разных приложений - так нарабатывается насмотренность для решения архитектурых задач. А тут бац, и человек собрал свой поисковик с 0 нуля и рассказал все нюансы создания: - как парсить данные - как их готовить - как их хранить - как эффективно инференсить поисковик, чтобы не ждать вечность - и сделать своё ai overview Сохраняйте и читайте 🔖

  • 15 янв.1 0535710

    Всем привет, live update: перехожу в стартап Krea.ai! Год в роли тимлида был продуктивным. Выстроил систему генерации контента (горжусь почти реалтайм видео генерацией), пару раз спидранил идеи до прода меньше чем за 3 дня и чудо - начал писать код, который бэкендеры не хотят переписать сразу. Сейчас понял: пора в эпицентр хайпа. Хочу в SF, поближе к умным ребятам и направлению World Models (мне очень нравится идея, что можно сгенерить целый мир по одному запросу). Мечта - собрать Skyrim или Minecraft по одному промпту и наконец-то легально вернуться в детство. Как только виза будет на руках, посмотрю вживую, как Скэм Альтман скамит народ. А пока кайфую от доступа к мощным GPU и будущей возможности погонять модели на B200. Почему Krea? Чуваки выпустили свой тюн на реализм Flux и Realtime Video. У них крутая философия: моделям сейчас не хватает "вкуса", и они хотят как "Прометей" дать каждому инструменты, которые позволят выражаться каждому человек. Короче, LFG! 🔥

  • Привет! Меня зовут Олег, я исследую, как оптимально скейлить языковые модели в Jülich Supercomputing Centre. Пока Андрей подзаряжается энергией для будущих постов, с его позволения поделюсь тут нашей новой работой — “Optimal Scaling Needs Optimal Norm”. Всем, кто задумывался о правильном тюнинге гиперпараметров — будет интересно! Главная проблема в скейлинге — как подбирать гиперпараметры (learning rate, batch size и т.д.) на масштабе >1B параметров и >100B токенов, когда перебор брутфорсом уже не вариант. Известные подходы вроде muP и других параметризаций гарантируют оптимальность при скейлинге модели, но не объясняют, что делать при увеличении размера датасета — скажем, с 1B до 1T токенов. Эмпирические scaling laws (пример или наша прошлая работа) помогают, но теории объединяющей всё вместе пока не существует. Мы подошли к этой проблеме со стороны norm-based optimization. Сейчас на хайпе Muon, который бьёт Adam, а в основе всего лежит теория Jeremy Bernstein (Modular Duality) — очень советую глянуть, это прям база. Также этот подход позволяет отслеживать эволюцию норм по слоям, и именно в них оказывается кроется секрет оптимального скейлинга! С Scion (улучшенная версия Muon) мы показали: чтобы достичь оптимального скейлинга одновременно модели и(!) датасета, нужно удерживать веса на одном и том же manifold’е — то есть сохранять норму весов постоянной при любом масштабе. Кроме того, мы вывели, как оптимально подбирать batch size и learning rate в этом сэтапе, выпустили Distributed Scion для тренировки на множестве GPU + открыли логи 2000+ экспериментов. В общем, всех инсайтов вкратце не описать, так что гляньте статью — буду рад обсудить идеи и услышать ваши мысли в комментах 😌 И апвоутните нас на Hugging Face! Было бы круто попасть в топ Daily Papers, мы уже очень близко 🚀

  • видео или голосовое, без подписи

  • Пока я путешествую по разным странам и набираюсь опыта, у меня не всегда остаётся время писать в канал. Хотя идей накопилось немало — год назад я о многих из них даже не думал. Чтобы заполнить паузу и заодно набраться мотивации через новых подписчиков, решил поучаствовать в папке. Я честно рекомендую ребят, которых приведу ниже — уделил время просмотру их контента: - Тимлид и работа руками — про то, как совмещать управление и свои задачи от друга Сани, у которого еще есть офигенный канал про то как стать тимлидом. - Коммуникация с бизнесом и умение говорить "НЕТ. Андрей круто рассказывает про то важно говорить, на желание построить космолёт. - Путь Арины — Арина ведет канал уже долго и мне понравилось, что можно посмотреть на путь развитие в DS/ML человека, и найти себя в этом пути. - Мотивация от Тани — Таня тоже рассказывает свой путь, но больше уделяет внимания внутренним переживаниям лично мне этого не хватает, часто контент это просто разбор статей+материалы, за которыми теряется реальный человек. - Длинный опыт в DS — тут из подборки один из самых опытных челов. Тут вы узнаете больше про решение реальных кейсов и проблем. Мне такое часто помогает — я раньше писал, что 30 минутный разговор может спасти вам месяцы работы Сама папка тут — уверен, каждому приглянётся хотя бы один канал. А я продолжаю путешествовать 🚶‍♂️🌍 https://t.me/addlist/v5lLkN7LNPQ4MmJi

  • Awesome DL pinned «Пост знакомство Я Андрей Филатов – Team Lead Gen AI CV в стартапе, занимаюсь применением генеративных моделей для создания визуального контента: создание изображений/видео, редактирования изображений/видео, создание персонализированных генераций. В ML/DL…»

  • Пост знакомство Я Андрей Филатов – Team Lead Gen AI CV в стартапе, занимаюсь применением генеративных моделей для создания визуального контента: создание изображений/видео, редактирования изображений/видео, создание персонализированных генераций. В ML/DL уже более 6 лет – с момента стажировки в Тинькоффе в 2019 году, где работал почти по соседству с Олегом Тиньковым и сохранил пару историй о нём. Затем был EPFL (где публиковался на NeurIPS) и работа в команде Kandinsky Sber AI. Параллельно мне нравится делиться знаниями. Вёл курсы в МФТИ (DL), в HSE/Sber/Сколтехе (CV), сейчас техлид курса по диффузионным моделям. А ещё иногда помогаю студентам с научным руководством. Философия канала ML-контент в телеграм часто повторяется поэтому моё желание писать на аутентичные темы, что внести вклад в общее ML знание русскоязычного коммунити. А с дальнейшим развитием вещать и на международную аудиторию 📌 Ключевая идея: объяснять сложное просто, писать аутентично. Что можно найти в канале? 🔹 Гайдбуки : • Диффузионные модели • Видео-диффузионные модели 🔹 Выступления и подкасты: • Генеративные аугментации, ещё один • Подкаст про искусство и ИИ 🔹 Разбор интересных тем: • Табличные данные в ML • Робототехника + ML (совместно с @TimeEscaper, он пишет в своём канале) • Kandinsky и важность синтетики • Синтетические данные в ML 💡 Если вам интересно сотрудничество, нужно консультация или просто интересно пообщаться, то пишите сюда @anvilarth

  • Channel photo updated

  • Хочу рассказать про канал моего друга Саида. Саид уже сделал одну из топовых моделей на HF, а сейчас полностью ушёл в работу над своим стартапом AnyAgent. Немного завидую — он выбрал идею и просто пошёл её делать — человек пошел за мечтой. AnyAgent — это ассистент, через который можно обновить календарь, запланировать встречу или распланировать день. Я попробовал сам — понравилось, как он помогает с микроменеджментом, особенно с календарём. Это то, что обычно забивает голову. Сейчас продукт находится в стадии бета тестировании и активно двигается к тому, чтобы создать единый портал для вашей жизни! Если интересно смотреть, как продукт строится с нуля, или просто хочется попробовать такого “джарвиса” — советую подписаться на канал Саида

  • Создал агента для ответов на вопросы В рамках своего вайб-кодинга я начал делать мини-демки, чтобы понять, какие полезные штуки можно собрать и параллельно своими действиями вдохновить людей создавать интересные вещи самостоятельно. Сейчас на хайпе — агенты: те самые, которые должны решать за вас задачи, работать быстро и эффективно и вообще сильно упрощать жизнь. В полноценную замену человека я пока не верю, но понимаю, что на API можно сделать много прикольных и реально полезных штук. Поэтому я провёл небольшой ресерч и пришёл к выводу: Самое простое и полезное применение агентов — это работа с большими материалами в формате Q&A. Логика очень простая: - собираешь базу знаний, - делаешь по ней быстрый поиск, - и вуаля — можно разгрузить себе голову от однотипных ответов. Так как я техлид по курсу «Диффузионные модели», я решил в рамках курса собрать MVP-бота, который будет отвечать на вопросы по материалам. Результатом стал бот: https://t.me/ImpressiveNameBot Пока это базовая версия, которая может отвечать на ваши вопросы по диффузионным моделям и помогать в сложных терминах, но следующим шагом планирую добавить память. За основу взял LangChain (от которого потом отказался из-за хостинга), к которому подключил OpenAI API. Код тут: Я планирую дальше развивать бота (основное, что хочется сделать это добавить ему память), и тут мне очень помог пост о том, как можно работать с векторными индексами в LLM. Помимо памяти, на Канале Доброго Вани ещё можно прочитать про технологическое предпринимательство, разного уровня материалы для Data Science, хакатоны — и много чего другого. Как появится свободное время, думаю, допилю бота, чтобы можно было использовать его не только как Q&A, но и как полноценного ассистента. P.S. Если у вас есть идеи как улучшить бота / добавить супер RAG, то буду рад любой помощи!)

  • Автоматизация контента в соцсетях У меня всегда была идея, что круто писать на зарубежную аудиторию. Там и охваты выше, и расти можно быстрее, потому что международный рынок контента более конкурентный — сразу видно, работает твой контент или нет. 💡 Поэтому я решил выйти в открытый океан и попробовать писать туда. Но как человек ленивый, быстро понял, что самому что-то новое сочинять влом. Решил переписать свои старые посты. Потом стало влом и это — и я сделал бота, который сам конвертирует посты из телеги в формат для других соцсетей ( с переводом и форматированием). С фидбэком от @fminxyz удалось довести первую версию до вменяемого состояния (пример на картинке это — https://t.me/fminxyz/30). Хотел уже выложить и дать всем попробовать, но Telegram внезапно выдал три бана на ботов и столько же раз выкинул из аккаунтов. Стало немного стрёмно. Так что пока не выкладываю публично. Но если хочется потестить — просто скиньте ссылку на пост в личку, и я покажу, как он может выглядеть после конвертации. Пока что так, по-тихому 🙃. P.S. В комментариях накинул еще примеров

  • o4-mini-high is AGI? Короче, решил потестить o4-mini-high на проге. Это жесть. ‣ По сравнению с o3, намного быстрее скорость инференса, вообще не приходится ждать. ‣ C точки зрения идей и решений — мама дорогая. Я где-то пару недель спрашивал людей как ускорять модели, она выдала все идеи после одного запроса и сразу же имплементировала. Для меня взрыв мозга. Конечно, если говорить о нишевых задачах — например, вырезание фона — тут всё ещё мимо: выдаёт фигню, потому что нужно реально видеть картинку и оценивать результат визуально. Но качество идей и решений — это просто взрыв мозга. Я в комментах приложил сравнение: простая реализация vs. реализация после нескольких уточнений. Раньше, чтобы просто понять, как это сделать, ушло бы недели две. А теперь — один запрос, и всё готово.

  • 🛠 Опыт is a key to success Последний год работы в стартапе сильно изменил моё отношение к тому, что такое опыт. Раньше мне казалось, что опыт — это просто накопленные знания и навыки. Но теперь я вижу, что настоящая сила опыта в другом: это грамотное распределение ресурсов на долгосрочной перспективе. Когда общался с автором xformers, он сказал, что одна из главных проблем стартапов (от себя добавлю, что и больших компаний в России) в гонке AI — понять, куда направить ресурсы. Вложиться в создание собственной технологии или подождать, когда кто-то другой выпустит уже готовое решение? И ответа на это нет, кроме одного — собственного опыта. Опыт — это искусство принимать грамотные решения, чтобы не тратить самый ценный ресурс — время — впустую. Если идёшь не туда, ты не просто теряешь время сейчас, ты ещё и теряешь время, возвращаясь назад. Самые дорогие ошибки — те, что происходят из-за недостатка опыта. Ты можешь даже не понять, что идёшь в тупик, пока не окажешься в начальной точке снова. Что изменилось в моём подходе сейчас? 1️⃣ Я перестал гоняться за самыми крутыми решениями просто потому, что они крутые. Теперь для меня важно видеть общую картину. Я выбираю простоту и устойчивость, потому что за такими решениями будущее. Подумайте, какие решения обеспечат стабильность вашего проекта в будущем. 2️⃣ Опыт даёт возможность видеть картину целиком — именно поэтому опытные руководители бесценны. Ты можешь делать всё правильно в моменте, но без общей стратегии через пару лет всё просто развалится. Есть ли у вас человек, который может помочь вам своим опытом? 3️⃣Если вам интересно узнать больше о грамотном принятии решений, рекомендую почитать вот этот пост. А также рекомендую самый простой способ начать собирать опыт — это набивать шишки и двигаться дальше самостоятельно. Не бойтесь экспериментировать и набираться опыта самостоятельно.

  • ⚡️SageAttention — brand new attention Flash Attention бустит классический attention по скорости, но что если я скажу, что можно еще быстрее, если правильно квантизовать Flash Attention. Sage Attention за счёт умной квантизации + понимании CUDA ускоряют Flash Attention 2 от 2x до 5x раз. Небольшое введение в квантизацию. Допустим, у нас есть матрица A, которую мы хотим перевести из формата FP16 в INT8. Для этого: 1. Сначала находим максимальное абсолютное значение элементов матрицы и вычисляем коэффициент скейлинга (scale factor): δA = max(|A|) / 127 2. Делим исходную матрицу на этот коэффициент и округляем, получая матрицу низкой точности \hat{A} (например, INT8): Â = round(A / δA) 3. После вычислений в низкой точности (например, произведения матриц AB), получаем итоговый результат, снова умножая на коэффициенты скейлинга: C ≈ (Â × B̂) × (δA × δB) Здесь приведен простой пример квантизации — на самом деле, факторы скейлинга можно выбирать для каждой строчки отдельно, что улучшить качество за счёт бОльшего числа факторов. В статье SageAttention про это подробно рассказано, рекомендую ознакомиться. Основной проблемой данного подхода является то, что могут возникать выбросы: Например, если в исходной матрице A: A = [0.1, 0.2, 0.15, 1000] То коэффициент скейлинга будет: δA = 1000 / 127 ≈ 7.87 И после квантизации получится: A_quant = round(A / δA) = [0, 0, 0, 127] Поэтому залог успешной квантизации, подумать головой и разобраться с выбросами, что и сделали в SageAttention. Небольшое введение в формулы и погнали: ➤ P = Attention = Softmax(QK^T / \sqrt{d}) ➤ V - value -> V* = PV SageAttention: ➤ Переводим вычисление QK^T в INT8 и стабилизируем выбросы с помощью нормализации матрицы K (это стандартная техника для борьбы с выбросами, берите на вооружение!). Дополнительно оптимально подбираем стратегию квантизации, глядя на структуру самих матриц. ➤ Делаем фьюзинг (объединение) операций скейлинга и анскейлинга с соседними слоями. ➤ Вычисление PV делаем в FP16 — так стабильнее, потому что FP8 слишком сильно теряет точность. SageAttention2: ➤ Современные GPU (например, Nvidia H100) поддерживают не только INT8, но и INT4. Поэтому теперь делаем квантизацию матриц Q и K в INT4, а также дополнительно нормализуем матрицу Q, чтобы не искажать итоговый результат attention. ➤ Реализуем глубокие CUDA-оптимизации. Например, оказывается, что масштабирование при квантизации можно параллельно применять сразу к элементам векторов по специальной формуле (каждый 8i + 2k + 1-й элемент). Жёсткая оптимизация на низком уровне GPU 🔥 ➤ Вычисления PV делаем в FP8, так как теперь нашли способ стабилизировать результат при помощи двойной буферизации с FP32 SpargeAttention: ➤ FlashAttention работает с матрицами поблочно. Если какой-то блок attention заполнен нулями, то считать его нет смысла — результат не изменится. ➤ Авторы придумали механизм, как быстро находить и пропускать такие блоки на основе похожести матриц Q и K. ➤ Дополнительно, в процессе вычисления attention можно пропускать отдельные блоки, основываясь на пороге. ➤ Поверх этой разреженности используется подход из SageAttention2 (с INT4-квантизацией и CUDA-оптимизациями). Результат 🔥 SageAttention уже быстрее, чем FlashAttention2 примерно в 2.1 раза (на RTX4090), а также на 2.7 раза быстрее xformers. При этом точность моделей практически не страдает. 🔥 SageAttention2 ускоряет attention примерно в 3 раза по сравнению с FlashAttention2 и в 4.5 раза быстрее xformers на RTX4090. 🔥 SpargeAttn ускоряет inference дополнительно, обеспечивая от 2.5 до 5 раз быстрее по сравнению с другими методами attention. Как применить у себя. Устанавливаем библиотеку и дальше делаем вот так import torch.nn.functional as F from sageattention import sageattn F.scaled_dot_product_attention = sageattn

Awesome DL — tgindex