DeepSchool
описание
Это канал школы deepschool.ru. Здесь мы будем: - напоминать вам теорию ML/DL в виде коротких постов, - задавать вопросы с собеседований, - рассказывать про полезные фреймворки - и делиться советами, которые помогут вам в работе. @deepschool_support
10 684
подписчиков
Охват к подписчикам
36,3%
ERR
Реакции к просмотрам
0,74%
641 на 22 постов
Пересылки к просмотрам
1,47%
1 272
Постов в день
0,3
всего 22
Где отзываются чаще
доля реакций к просмотрам- 14 авг.без подписи2,71%
- 19 июн.Reinforcement Learning: пошаговый план изучения Reinforcement Learning (RL) лежит в основе многих ключевых достижений современного ИИ: обучение роботов локомоции и манипуляции, пост-обучение языковых моделей (RLHF, GRPO). Сегодня понимание RL — нужный навык для широкого круга ML-инженеров. Чтобы помочь прокачаться в этой области, мы подготовили пошаговый план изучения и полезные ресурсы. Welcome 🙂 ⚫️План изучения 1. Основы теории вероятностей RL опирается на аппарат теории вероятностей и стохастических процессов. Фундамент для понимания: условные вероятности, математическое ожидание и его свойства, основы стохастических процессов. Изучать эти темы лучше по мере необходимости: столкнулись с importance sampling — сразу разбираемся с этой концепцией. Ресурсы: MML (главы по вероятностям и статистике); любой базовый курс теории вероятностей. 2. Классический RL Можно начать с формализма марковских процессов принятия решений (MDP): состояния, действия, функция перехода и вознаграждения, дисконтирование. И затем перейти к табличным методам: dynamic programming, Monte Carlo, temporal-difference learning, Q-learning, SARSA. Рекомендуем решать задачи из книги или курса — это критически важно для понимания. Ресурсы: S&B (Part I) — фундаментальный учебник по RL; Stanford CS234 — академический курс с задачами. 3. Deep Reinforcement Learning Когда пространство состояний становится слишком большим для табличных методов, применяется аппроксимация функций с помощью нейронных сетей. Ключевые темы: Deep Q-Network (DQN), policy gradient методы, actor-critic архитектуры, методы на основе модели (model-based RL). Если нужно подтянуть основы Deep Learning, рекомендуем открытую книгу Understanding Deep Learning. Ресурсы: Deep RL (CMU) — курс от Katerina Fragkiadaki с современными методами deep RL; Deep RL (UC Berkeley) — курс от Sergey Levine с открытыми домашними заданиями. Рекомендуем выполнить все практические задания. 4. Policy Gradient и современные алгоритмы Для практического применения RL необходимо глубокое понимание policy gradient методов. Ключевые алгоритмы: REINFORCE, TRPO, PPO — стандарт в робототехнике и RLHF; GRPO — активно применяется в пост-тренировке LLM. Важно не только знать алгоритмы, но и понимать, почему они работают: какие допущения лежат в их основе и какие практические трюки обеспечивают устойчивое обучение. Ресурсы: S&B (Part II); лекции из курсов CMU и UC Berkeley по policy gradient. 5. Современный RL и применения После основ — обзор современных направлений: RLHF для языковых моделей, применение в робототехнике, мультиагентный RL, offline RL, model-based RL. Ценным будет понимание практических «трюков», которые стоят за успешными алгоритмами. Ресурсы: PML:AT (Kevin P. Murphy) — современные работы в RL и практика к языковым моделям; Substack Cameron Wolf — разборы алгоритмов и их применение к LLM доступным языком. 6. Практика Мы верим, что действительно глубокое понимание невозможно без практического опыта. Рекомендуем два направления в зависимости от области интересов: робототехника: курс LeRobot (Hugging Face) с фокусом на RL-часть; самостоятельное обучение реального или симулированного манипулятора; языковые модели: самостоятельная реализация RLHF (CS336). ✅Полезные ресурсы Reinforcement Learning: An Introduction (S&B) — Sutton & Barto Stanford CS234: Reinforcement Learning Deep RL (CMU) — Katerina Fragkiadaki Deep RL (UC Berkeley) — Sergey Levine Probabilistic Machine Learning: Advanced Topics (PML:AT) — Kevin P. Murphy LeRobot курс (Hugging Face) Stanford CS336: Language Modeling from Scratch, assignment 5 Substack Cameron Wolf Автор: Шамиль Мамедов Ревьюер: Антон Наумов Помимо робототехники и LLM, RL используется ещё и для обучения LLM-агентов. Об этом глубже рассказываем на нашем курсе по LLM для ML/DL-инженеров. Также там разбираем fine-tuning, alignment, ускорение и деплой LLM. Новый поток стартует 30 июня, а до 21 июня вы можете присоединиться со скидкой 20%!1,67%
- 5 авг.без подписи1,39%
- 7 авг.Как сегодня обучают AI-агентов? 🤖 LLM уже умеют писать код, пользоваться браузером и самостоятельно выполнять сложные задачи. Но как их этому обучают? В новой статье разбираем, почему классического RLHF оказалось недостаточно, что такое Agent Reinforcement Learning, зачем нужны Verifiable Rewards и Credit Assignment, и как современные методы позволяют агентам находить эффективные стратегии самостоятельно. Читайте разбор по ссылке! 👈🏼 Соберите полноценные LLM-системы с учётом требований к качеству и нагрузке, разберите сложные кейсы и дизайны NLP-решений у нас на курсе. Новый поток стартует 18 августа, а до 9 августа вы можете присоединиться со скидкой 20%! 🪔 DeepSchool1,20%
- 9 июл.FlashAttention-3 и FlashAttention-4 — пример того, как алгоритмы нужно заново адаптировать под каждое поколение GPU 🚀 В новой статье разбираем, почему FlashAttention-2 отлично работал на Amper'е, но уже не раскрывал потенциал архитектур Hopper и Blackwell и какие архитектурные изменения вновь ускорили attention. Вы узнаете: • почему на H100 FA-2 просел по утилизации GPU • как Tensor Memory Accelerator и асинхронные Tensor Cores ускорили FA-3 • зачем нужна warp-специализация • как matmul и softmax удалось выполнять параллельно • что даёт FP8 с контролем ошибок • и почему для Blackwell снова понадобилась перестройка во FlashAttention-4 Читайте разбор по ссылке! 👈🏼0,94%
- 26 июл.DeepSchool Digest⚡ Собрали для вас материалы за июнь и июль в одном посте ☀️ Как собрать хорошие траектории для обучения LLM-агента — LLM-агенту недостаточно просто отвечать текстом: важно научить его выбирать действия и работать с инструментами. Разобрали, какие данные здесь нужны, и почему одного SFT обычно мало. Late chunking — рассказали, как улучшить векторный поиск в RAG без сложной нарезки чанков. Reinforcement Learning — подготовили пошаговый план изучения и полезные ресурсы. Genie family — подготовили серию постов о современных world-моделях и 3D-генерациях мира. И начали с семейства Genie от Deepmind. FlashAttention-3 и FlashAttention-4 — разобрали, почему FlashAttention-2 отлично работал на Amper'е, но уже не раскрывал потенциал архитектур Hopper и Blackwell, и какие архитектурные изменения вновь ускорили attention. Как свёрточные сети меняли компьютерное зрение — разобрали эволюцию CNN как последовательность инженерных ответов на ограничения предыдущих поколений моделей.0,88%
- 31 июл.Хорошие практики LLM-as-a-judge LLM-судьи позволяют быстро оценивать тысячи ответов, но один промпт и аккуратный выход в формате JSON ещё не гарантируют надёжную оценку. Судья может пропускать ошибки, менять вердикты из-за формулировки промпта или уверенно оценивать ответ, когда ему не хватает данных. В новой статье разобрали шесть практик, которые помогают сделать LLM-оценку надёжнее: от формулировки критериев и проверки на человеческой разметке до анализа ошибок, смещений и расхождений между судьями. Всё — на реальном кейсе shopping-ассистента. Читайте новую статью по ссылке! Соберите полноценные LLM-системы с учётом требований к качеству и нагрузке, разберите сложные кейсы и дизайны NLP-решений у нас на курсе. Новый поток стартует 18 августа, а до 9 августа вы можете присоединиться со скидкой 20%! Автор: Алексей Яндутов0,86%
- 13 авг.Как собирать NLP-системы, которые работают под нагрузкой Обучить модель, построить эмбеддер или воспользоваться API — не значит запустить рабочую систему. RAG галлюцинирует, агент ломается на реальных сценариях, эмбеддинги не работают на специфичном домене. С этими и другими проблемами мы разберёмся на курсе LLM Pro, который стартует 18 августа! На курсе вы научитесь: • проектировать и запускать NLP-системы под реальные продуктовые задачи • адаптировать LLM и эмбеддинги под специфичный домен и «живые» данные • собирать и размечать датасеты — даже если данных изначально почти нет • решать задачи классификации, поиска, кластеризации и NER — с ограничениями продакшн-среды • собирать свою RAG-систему: от ретривера и реранкера до генератора и оценки качества • строить AI-агентов с нуля — на основе сценариев, функций и взаимодействия с внешней средой Приходите, чтобы узнать про best practices от опытных инженеров из продуктовых команд и применять похожие подходы в своих проектах 🤖 До 17 августа вы можете присоединиться к обучению со скидкой 5%! Изучайте программу и отзывы на сайте и записывайтесь на ближайший поток 🎓0,82%
- 15 июн.CTF по LLM 💻 CTF (Capture The Flag) — это соревновательный формат, где участникам даётся живой объект для исследования: сервис, код, сайт, чат-бот. Внутри спрятана секретная строка-флаг. Задача: разобраться в системе, найти слабое место и «вытащить» флаг. Нашёл флаг → решил задачу → получил баллы. Подготовили для вас трек по LLM. LLM, RAG, агенты: от prompt-инъекций до внутренностей модели. Всего 7 задач, появляться будут в 19 Мск в течение недели. Первая задача уже доступна. В ней нужно обойти цензора, которого поставили поверх слишком разговорчивой модели. https://contest.deepschool.ru/t/llm/boltun Под анонсы задач и разборов завели отдельный канальчик @deepschool_ctf, заглядывайте! Делитесь с друзьями и коллегами, вместе решать веселее 💻0,79%
- 17 июл.Как свёрточные сети меняли компьютерное зрение Почему AlexNet стала переломным моментом, чем VGG упростила архитектурный дизайн, как ResNet решила проблему глубины и зачем MobileNet, EfficientNet и ConvNeXt по-разному оптимизировали точность, скорость и масштабирование? ✅ В новом видео разбираем эволюцию CNN как последовательность инженерных ответов на ограничения предыдущих поколений моделей. Смотрите видео по ссылке: https://youtu.be/l5kAIVbFQJ4?si=mdJlnY20mageDq36 🪔 DeepSchool0,73%
- 29 июн.Genie family Сегодня всё больше внимания уделяется «world-моделям». Они способны не только генерировать красивые кадры, но и контролировать физичность, геометрию, создавать интерактивную среду и реальные симуляции. ✅ Мы подготовили серию постов о современных world-моделях и 3D-генерациях мира. И начнём с семейста Genie от Deepmind. Посмотрим, с чего всё начиналось и как за пару лет с простой симуляции в маленьком разрешении 2D-структур эти модели превратились в высококачественные генераторы симуляционных сред. Читайте статью по ссылке! 👈🏼0,70%
- 11 июн.Как улучшить векторный поиск в RAG без сложной нарезки чанков? В объёмных (юридических / медицинских) документах смысл фрагмента часто зависит от контекста. В классическом RAG документ режут на чанки и векторизуют каждый по отдельности. В результате — сбой в поиске, потому что часть смысла чанка лежит за его границами. ⚫️Late chunking — техника от Jina AI, которую обычно пропускают в RAG-туториалах. Основная идея: вместо предварительной обрезки текста прогоняем через модель весь документ и получаем вектор для токенов, каждый из которых уже «впитал» контекст текста. Эмбеддинг чанка — усреднение (mean pooling) векторов его токенов. Текст подаётся целиком или большими частями с перекрытием. Это «дороже» с точки зрения вычислений, зато у вектора каждого чанка больше контекста. 💡Пример из статьи: в начале документа стоит «Берлин», далее — «город», «он», «его население». При наивной нарезке чанк «его население…» не содержит слова «Берлин», и модель не связывает местоимение с сущностью. При late chunking тот же чанк «помнит» про Берлин. На длиннодокументных retrieval-бенчмарках late chunking почти всегда обходит наивную нарезку без дообучения. ⚫️Что использовать: - jina-embeddings-v3/v4 (v5 уже не подойдёт — другой тип пулинга) - модели Perplexity (pplx-embed-context-v1), более современные, обученные под late chunking специально Автор: Александр Абугалиев Глубже про векторный поиск и RAG рассказываем на нашем курсе по LLM для ML/DL-инженеров. Также там разбираем fine-tuning, alignment, агентов, ускорение и деплой LLM. Новый поток стартует 30 июня, а до 21 июня вы можете присоединиться со скидкой 20%!0,70%