Data Scientist | IT
описание
Добро пожаловать в клуб. Полезные материалы из мира DS & ML на регулярной основе. По всем вопросам: @godinmedia
Лучшие посты
за три месяцаБазовая модель для персонализированных рекомендаций Netflix #почитать Персонализированная рекомендательная система Netflix устроена довольно сложно. В её состав входят различные специализированные модели машинного обучения, каждая из которых ориентирована на решение особых задач, в том числе — на обслуживание разделов «Continue Watching» («Продолжить просмотр») и «Today’s Top Picks for You» («Сегодняшние топ-рекомендации для вас»). (Подробности об этом вы можете найти в нашем недавнем обзоре). Но по мере того, как мы расширяем используемый нами набор алгоритмов персонализации, стремясь соответствовать растущим бизнес-потребностям, поддержка рекомендательной системы становится довольно-таки затратной. Более того, мы столкнулись со сложностями при переносе инновационных решений из одной модели в другую. Это так из-за того, что большинство моделей обучаются независимо друг от друга, хотя и пользуются одними и теми же источниками данных. Всё это логично привело к возникновению необходимости в новой архитектуре рекомендательной системы, где модели обучаются предпочтениям пользователей централизованно. Это расширяет доступность и полезность результатов обучения одних моделей для других моделей. ✅Читать статью
LLM модели: зарубежные VS отечественные #почитать Когда команда выбирает LLM для продакшена, «сравнение по бенчмаркам» — это лишь первый фильтр. Для CTO ключевой вопрос звучит иначе: какую комбинацию качества, стоимости, стабильности API, юридических ограничений и интеграций мы получим на реальной нагрузке. Я разобрал популярные модели через призму двух контуров: качество/бенчмарки и инфраструктурная пригодность. ✅Читать статью
AGI: почему его не будет, и какую модель мы можем сделать вместо него #почитать AGI это следующий этап развития ИИ. Подобная модель сможет самостоятельно изучать и решать задачи, совершать новые научные открытия, и в принципе это таблетка от всех проблем. По крайней мере, так считают современные техногиганты, в особенности Илон Маск или Сэм Альтман, которые яро пропагандируют идеи AGI и вот-вот обещают выпустить подобную модель. Но, к сожалению или к счастью, это невозможно, и вот почему. ✅Читать статью
От MNIST к Transformer. Hello CUDA. Основы, Setup и наше первое ядро #почитать Мы живем в эпоху, когда ИИ стал доступен каждому. Но за магией PyTorch скрывается колоссальная инженерная работа и сложные вычислительные процессы, которые для большинства остаются черным ящиком. Я хочу запустить большой цикл статей От MNIST к Transformer, цель которого пошагаво пройти путь от простого CUDA ядра до создания архитектуры Transformer - фундамента современных LLM моделей. Мы не будем использовать готовые высокоуровневые библиотеки. Мы будем разбирать, как все устроено под капотом, и пересобирать их ключевые механизмы своими руками на самом низком уровне. Только так можно по настоящему понять как работают LLM и что за этим стоит. Приготовьтесь, будет много кода на C++ и CUDA, работы с памятью и погружения в архитектуру GPU. И конечно же математика что за этим стоит. ✅Читать статью
Не «как быстрее», а «как лучше»: новое ML-ранжирование маршрутов в Яндекс Картах #почитать Раньше маршруты на Картах ранжировались по времени в пути: работал принцип «самый быстрый — самый первый». Но в реальном мире скорость не всегда равна удобству и пользователь мог оказаться в ситуации, что маршрут вроде бы позволяет добраться до конечной точки быстрее, но придётся долго разбираться, а куда вообще ехать. Теперь ранжированием маршрутов занимается ML‑модель, которая обучена на реальном поведении пользователей. Она учитывает не только время, но и то, по каким маршрутам водители доезжают до конца. Поэтому сейчас первый вариант — тот, который вы, скорее всего, выбрали бы сами. ✅Читать статью
Как развернуть OpenClaw и не слить ему все свои данные #почитать OpenClaw (ex. Moltbook и Clawdbot) мощно взорвал начало года. Все бросились устанавливать себе агента, и я понимаю, почему получился такой хайп. Ведь это первый в мире опен сорсный персональный AI-ассистент, которого можно подключить к мессенджеру, почте, календарю и практически чему угодно еще и он будет управлять моей личной жизнью. Ему можно поручить покупку билетов в кино, бронь столика в любимом кафе или внести важную встречу в календарь. Другая сторона хайпа — вопросы к безопасности агента, здесь шумихи не меньше. То исследователи Gen Threat Labsнашли 18 000 открытых инстансов OpenClaw, к которым можно подключиться и управлять уже не своей, а чужой личной жизнью. То Касперский пишет, что каталог «навыков» агента стал рассадником вредоносного кода. Или вспомнить историю о том, что OpenClaw сливал данные своих пользователей через Moltbook (соцсеть для нейронок). И что теперь, совсем нельзя пользоваться этим агентом? Я считаю, что пользоваться можно, но осторожно и лучше в облаке. Расскажу, как это сделать безопасно. ✅Читать статью
Семантический компьютер на 64 нейронах и обучение на шуме #почитать В предыдущей статье о машинном обучении как алхимии я говорил о том, что можно найти новые решения, не используя GPU или дорогие видеокарты. В этой статье я расскажу, о том, как я экспериментировал с continual learning и композициональностью мышления на микронейросетях, и причем здесь философ Лев Выготский. ✅Читать статью
Я обучил модель на 10 000 код-ревью, чтобы отсеять мусор. Она начала предсказывать увольнения #почитать Я хотел решить простую инженерную задачу: отсеять «шум» в комментариях на код-ревью. Обучил модель на 10 000 примеров, получил точность 87%. Потом открыл список ошибок. Оказалось, модель научилась предсказывать увольнения сотрудников за два месяца до того, как они принесут заявление. Рассказываю, как «пустые» комментарии выдают выгорание и почему данные иногда знают о нас больше, чем мы сами. ✅Читать статью
Модели, гипотезы и планирование: хроники ML-инженера на крупнейшем хакатоне #почитать В прошлом году наша команда неожиданно для себя стала призером на хакатоне «Лидеры Цифровой трансформации». В этой части мы расскажем технические детали решения задачи по распознаванию поврежденных и больных деревьев в городской среде. ✅Читать статью
⚠️Хотите разобраться, как обучать интеллектуальных агентов в нестандартных задачах для бизнеса? Начните обучение на курсе «Reinforcement Learning». 🎁Записывайтесь на 3 бесплатных вебинара — познакомьтесь с программой обучения и преподавателями. Задайте свои вопросы экспертам! Вебинар 1: «Обучение с подкреплением - гибкий подход для сложных задач. Создаем собственные окружения». ⏰7 июля в 20:00 мск Программа вебинара: 1. Краткое введение в обучение с подкреплением. 2. Обзор существующих сред и переход к созданию собственного RL-окружения на Python. 3. Напишем свою среду на основе gym.Env и подключим к ней обучающегося агента. Вебинар 2: «Visual DQN: Как научить ИИ-модель видеть мир глазами игрока». ⏰15 июля в 20:00 мск Программа вебинара: 1. Разберем, как DQN работает с изображениями: как агент получает состояние не в виде чисел, а в виде сырых пикселей с экрана. 2. Изучим архитектуру DeepMind-подхода. 3. Запустим обучение DQN в среде Atari Pinball и посмотрим, как агент постепенно учится играть лучше человека. Вебинар 3: «Алгоритм DQN - учим нейросеть принимать решение без помощи человека». ⏰21 июля в 20:00 мск Программа вебинара: 1. Разберем устройство алгоритма DQN: как нейросеть заменяет Q-таблицу и учится выбирать лучшие действия. 2. Изучим ключевые механизмы DQN. 3. Обучим агента решать задачу в среде Gymnasium и проанализируем процесс обучения. Записывайтесь ➡️ https://vk.cc/cZn70D Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576
Архитектура «Обратного Хэша»: Нейросети без умножения #почитать Современный Deep Learning уперся в производительность вычислений с плавающей точкой (float) и пропускную способность памяти. Мы предлагаем архитектуру «Обратного Хэша», где нейрон — это не сумма произведений, а битовая функция. Ноль умножений. Ноль сложений. Только логика (XOR), статистика и скорость света. ✅Читать статью
Поиск аномалий: статистика или ML? Выбираем лучшее #почитать Поиск аномалий под микроскопом: от базовой статистики до робастных моделей с нуля на NumPy В машинном обучении поиск аномалий (Anomaly Detection) часто остается в тени классического обучения с учителем. Однако именно эта «иммунная система» данных спасает миллионы долларов в финтехе, предотвращает катастрофы на производстве и находит критические ошибки в медицинских картах. В этой статье мы не просто импортируем готовые методы из sklearn. Мы разберем математическую логику трех мощных подходов, напишем их «примитивные» реализации на NumPy/Pandas, чтобы понять механику работы «под капотом», и проверим их в деле на реальном кейсе. Наш полигон: Credit Card Fraud Detection Для тестов мы возьмем классический датасет Credit Card Fraud Detection. Это идеальный пример «иголки в стоге сена»: здесь всего 0.17% мошеннических транзакций среди почти 300 тысяч записей. Смогут ли наши рукотворные алгоритмы их найти? ✅Читать статью
Anthropic против OpenAI: два разных подхода к «быстрому режиму» #почитать Anthropic и OpenAI почти одновременно запустили «быстрый режим» для своих моделей — и за одинаковым названием скрываются принципиально разные подходы к ускорению инференса. В одном случае это реальная модель с уменьшенным батчингом, в другом — отдельная, более компактная версия на специализированных чипах Cerebras. Разбираемся, что именно стоит за цифрами «2.5×» и «1000 токенов в секунду», где компромисс по качеству и что это значит для разработчиков на практике. ✅Читать статью
Когда недостаточно ошибок I/II рода и нужно уточнить результат A/B теста #почитать Для запуска А/В теста необходимым минимумом является фиксация ошибок первого и второго рода, расчет MDE (минимальный наблюдаемый эффект). Однако при расчете результатов теста далеко не всегда получается достичь MDE заданного размера, в таком случае статистическая значимость результатов не будет достигнута. Помимо этого даже при статистически значимом результате существует вероятность ошибки, при которой наши результаты являются выбросом или просто случайностью. Как быть в таком случае? ✅Читать статью
Как мы оцениваем качество ИИ с помощью ИИ #почитать Заказчиками для ИИ инструментов часто выступают профильные специалисты (от науки или из мира бизнеса), которые не настолько погружены в работу моделей, чтобы легко оперировать метриками ROC-AUC (способность модели различать классы) или Precision (насколько точными являются положительные предсказания модели). Мы подумали, если большие языковые модели способны разъяснить сложные вещи ― например, смету и планы ― то их вполне можно использовать и для оценки самих систем ИИ. почему бы им не показать, что сами системы ИИ работают хорошо или не очень? Наша команда разработала инструмент, который позволяет осуществлять оценку и контроль качества моделей ИИ. Он может оценивать качество данных, сравнивать разные модели и потенциал их дообучения, а также подсказывать свои модели с помощью интегрированного инструмента AutoML от наших коллег из Института ИИ ИТМО, экономя время разработки. ✅Читать статью
50 LLM-клеток пытались построить организм. Вот что получилось #почитать Что если заменить клетки из «Игры в Жизнь» Конвея на крошечные нейросети? Я провел эксперимент: выдал каждой клетке свой «мозг» — LittleLM весом всего 6 килобайт — и заставил их договариваться друг с другом. Вдохновившись опытами биолога Майкла Левина, я попытался вырастить цифровой организм из 50 автономных агентов. В результате они не только построили структуру без единого центра управления, но и изобрели «рак». ✅Читать статью
Лидеры по работе с данными и ИИ из Альфа-Банка, Сбера, X5 Tech, Т-Банка, Ozon Fintech, Банка России, Дикси, Ситидрайва, Lamoda, Черкизово и других компаний расскажут, как данные и искусственный интеллект помогают ускорять бизнес в финтехе, ритейле, промышленности, транспорте и агросекторе. 9 июля на форуме Data Day 2026: 💰 Тренды AI и данных «из первых уст». На какие технологии и подходы делают ставку лидеры рынка? 💰 Как превратить хаос данных в надежный бизнес-навигатор и сделать данные стратегическим активом компании. 💰 Практика внедрения AI и data-driven подходов в финтехе, ритейле, логистике, промышленности и агросекторе. 💰 Как находить новые точки роста, используя опыт цифровых лидеров и сильные data-команды. 💰 AI-hub: выставка и центр экспертизы готовых AI-решений и автономных агентов для бизнеса. Выступают: – Руслан Булатов, Банк России. Директор Департамента финансовых технологий. – Дмитрий Криволапов, Lamoda. Директор департамента по данным и аналитике. – Алексей Бондаренко, Газпромбанк. Вице-президент — начальник департамента управления данными. – Дмитрий Рузанов, Альфа-Банк. Директор департамента разработки моделей. – Павел Денисенко, X5 Tech. Директор департамента развития платформы больших данных. – Артём Летин, ВТБ. Начальник управления моделирования КИБ и СМБ, вице-президент. – Валерий Поляков, Т-Банк. Лидер по данным группы Т-Технологии (Chief Data Officer). – Александр Лукьянов, ДОМ РФ Технологии. Генеральный директор. – Валентина Рудик, Ozon Fintech. Руководитель розничного кредитования. – Андрей Скачёк, М.Видео, Директор по маркетингу И другие. Вас ждет самый масштабный Data Day: 🔥 5 отраслевых треков (Финтех, Агропром, Путешествия и Транспорт, Ритейл, Персональная эффективность) 🔥 1500+ участников 🔥 60+ спикеров 9 июля, «Бизнес. Техноград», ВДНХ, Москва. Присоединяйтесь! Форум соберет экспертов по данным и AI из банков, ритейла, телекома, транспорта, агропрома, ИТ-компаний и индустриальных лидеров. 👉 Программа и регистрация Реклама. ООО «Регламент». ИНН 7708323273. erid:2W5zFJJ3D6q
Почему AutoML не «магия», а способ выжить в промышленном ML #почитать Когда в компании появляется первая ML‑модель, кажется, что самое сложное выбрать алгоритм и добиться хороших метрик. Но настоящий вызов начинается позже: когда моделей становится десятки, затем сотни, а скорость бизнеса начинает требовать обновлений не раз в год, а раз в недели. В Страховом Доме ВСК мы довольно быстро поняли: без стандартизации и автоматизации машинного обучения масштабирование превращается в хаос. Так у нас появился собственный AutoML‑фреймворк как ответ на реальные боли промышленного ML. ✅Читать статью
Компьютерное зрение и обучение нейросетей: 12 бесплатных ресурсов для погружения в тему #почитать Собрал для вас подборку материалов по компьютерному зрению и обучению нейросетей. Здесь вы найдёте полноценные курсы, туториалы, обзорные статьи и справочные материалы. Подборка пригодится как новичкам в ML, так и практикующим инженерам — старался пояснять в описаниях, для кого подойдёт конкретный материал. ✅Читать статью
Как гуманитарий за 2 месяца с нуля RAG систему построил, или Парсинг PDF по-хардкору #почитать Сегодня я расскажу о том, как я за 2 месяца с полного нуля создал доменную RAG систему с корпусом в 20+ книг. В статье затрону проблемы парсинга данных (особенно PDF документов, с которыми приходилось иметь дело), чанкинга, создания и индексации эмбеддингов, а также самого интересного – ретривера. Расскажу о latency, трейд-оффах, и сложностях реализации подобных систем локально на ноутбуке (хоть и «игровом») без использования API LLM. Вся система делалась мной самостоятельно без использования LangChain – это чистый пайплайн от Tesseract, Pillow, MuPDF/Fitz до e5-multilingual, FAISS (+bm25, который я затрону в статье) и Qwen3:8B в качестве LLM. ✅Читать статью