Охват к подписчикам
206,7%
ERR
Реакции к просмотрам
2,32%
968 на 21 постов
Пересылки к просмотрам
0,86%
359
Постов в день
0,0
всего 21
Где отзываются чаще
доля реакций к просмотрам- 25 мар.Открыт и рад любому фидбэку Ставь палец вверх если хочешь такой же разбор LRU, LRU-K, LFU. Спрашиваю потому что эти задачи намного популярней чем skip list5,89%
- 7 июл.Когда решил вспомнить как писать код руками4,86%
- 17 июн.Лучшей мотивации работать над банкоматами Платы не найти4,59%
- 8 июл.Недавно осознал что перестал пользоваться игровым ноутом, купленным осенью прошлого года. Так сказать закрыл гештальт в становлении киберкотлетой. С продажи ноута купил Starlight Air M4 на 24 gb, их разбирают как горячие пирожки, урвал за 106к рублей3,95%
- 9 авг.LLM Inference 🤔 Вопрос в LLM -> ответ на выходе. Делится на два этапа - prefill, decode Prefill - получение первого output токена и заполнение KV cache. Промпт превращается в токены, токены в эмбеддинг-векторы, затем attention обогащает каждый токен «важностью» относительно остальных. Все токены промпта обрабатываются за один проход, поэтому на каждый прочитанный байт весов приходится много вычислений - GPU загружен, этап compute-bound Метрика измеряющая Prefill - TTFT (time to first token): время от начала запроса до первого токена Decode - то как LLM печатает ответ по слову. LLM авторегрессивно(на основе предыдущего токена) генерит токен. На этом этапе активно читаются веса модели, мало вычислений на объем прочитанных данных - gpu простаивает, поэтому этот этап memory-bound. KV cache - сохранённые векторы K и V каждого обработанного токена. Нужен чтобы на каждом шаге decode не пересчитывать предыдущие токены заново Метрика для decode, TPOT - time per output token ——————————— Я запустил Naive(без оптимизаций) vs vLLM на RunPod для измерения TTFT, TPOT и GPU-метрик Пропускная способность (64 запроса) tok/s Naive 420 vLLM 2475 (6x) Скорость ответа(p50) TTFT TPOT Naive 158мс 148мс vLLM 206мс 20мс GPU-метрики GPU% Mem% VRAM(MiB) Naive 26 20 15028 80 76 15030 57 54 15106 vLLM 100 100 22274 100 100 22274 100 100 22274 Memory util - насколько занята шина, передающая данные VRAM -> SM Как видно TPOT у vLLM ниже в 7 раз из-за continuous batching - новые output токены генерируются одновременно в рамках батча, что убирает ожидание, также данная оптимизация помогает держать arithmetic intensity на GPU при decode, что не дает GPU простаивать - загруженность 100% TTFT стал хуже. Он и так растёт с числом запросов, но continuous batching усугубляет: decode забирает token budget (лимит токенов на шаг) первым, на prefill новых запросов остается мало - они ждут очереди, первый токен задерживается С памятью работает PagedAttention - идея из виртуальной памяти ОС. KV cache делится на блоки фиксированного размера, таблица блоков сопоставляет логические физическим. Нет фрагментации, значит в ту же VRAM влезает больше запросов -> больше батч Отсюда и константа 22274 MiB в метриках: резервация памяти просходит сразу на старте. У naive память ползёт вверх (15028 -> 15106) - аллокация по ходу запросов3,44%
- 3 апр.Все разрабы пока фича вайбкодится3,21%
- 10 июл.На этой неделе подался на рабочую визу D по ВКС(высококвалифицированный сотрудник) Должность у меня IT Security Systems Developer, так как диплом по информационной безопасности Как это устроено, сначала документы: рабочий контракт, справки об отсутствии судимости, диплом отправляются в миграционный офис Испании. Там проверяют Плату как работодателя и затем выдается апрув в виде приглашения, по факту это апрув на внж на три года которое начинает действовать с момента выдачи. Далее нужно придти в консульство и получить визу Вся канитель длилась 2 месяца - 1 месяц на получение апрува и еще месяц на запись в визовый центр, благо не пришлось ехать в рф, с 1 июня можно податься на рабочую визу через визовый центр по месту жительства2,93%
- 22 апр.Нужно качать линкедин говорили они В этом время линкедин чела который сменил Тим Кука Интересно какой у его профиля SSI2,64%
- 2 апр.Наблюдение #1 Всегда уточняй какой палец вверх имеешь в виду Наблюдение #2 Тг посты не подходят для описания сложных, технических вещей, перенес skip list в telegraph, посмотрю как пойдет https://telegra.ph/Skip-List-04-022,58%
- 9 июн.На канале добавилось 100+ подписчиков, всех рад видеть❤️. Чутка о себе - работаю в Плате, делаю бэк для банкоматов, недавно заехали в прод. Олег тыкал тестовый банкомат, пополнение отвалилось, но пока не уволили🏆🏆 Летом планирую переезжать в Барселону. В прошлом году был interview loop в aws - ищется по #aws - то с чего начался мой канал Здесь стараюсь писать интересно о технических вещах и о том как развиваюсь. На данный момент сижу в codecrafters.io, использую mathacademy чтобы прокачивать матан, также начал вкатываться в архитектуру LLM, щупаю этот домен в поисках интересного для себя Главная цель это канала - общение с людьми и шаринг знаний, опыта и мотивации😘 Напишите в комментах о себе - все чем хотите поделиться2,56%
- 7 маябез подписи2,40%
- 29 маяВ универе я учился на информационную безопасность Мы с другом решили погрузиться в мир нейросетей через матлаб - запустили перцептрон, cкормили первую часть последовательности из 0 и 1 и пытались предсказать продолжение. Хотели прогнозировать действия хакера при взломе автоматизированной системы. По итогам написали статью в журнале нашего универа. Я скормил ее чат гпт и он выдал краткое описание статьи🤔 Статья выглядит как: 1) Мы скормили MATLAB бинарные нули и единицы 2) Нейросеть обучилась 3) Все злоумышленники вычислены Если подумать, то в 2026 году примерно так и выглядит любой AI-стартап: 1) Мы скормили модели бинарные нули и единицы 2) Accuracy вырос после x10 нейронов 3) Ищем инвестиции Еще в те времена - 2016, было все понятно про AI P.S За опубликование статьи получили 13к стипендии в течении семестра🥂2,33%