tgindex

Data Scientist | IT

описание

Добро пожаловать в клуб. Полезные материалы из мира DS & ML на регулярной основе. По всем вопросам: @godinmedia

1 910
подписчиков
Охват к подписчикам
10,1%
ERR
Реакции к просмотрам
0,81%
86 на 50 постов
Пересылки к просмотрам
1,43%
151
Постов в день
0,3
всего 283

Где отзываются чаще

доля реакций к просмотрам
  • 17 июл.Когда недостаточно ошибок I/II рода и нужно уточнить результат A/B теста #почитать Для запуска А/В теста необходимым минимумом является фиксация ошибок первого и второго рода, расчет MDE (минимальный наблюдаемый эффект). Однако при расчете результатов теста далеко не всегда получается достичь MDE заданного размера, в таком случае статистическая значимость результатов не будет достигнута. Помимо этого даже при статистически значимом результате существует вероятность ошибки, при которой наши результаты являются выбросом или просто случайностью. Как быть в таком случае? ✅Читать статью3,02%
  • 27 июл.Как гуманитарий за 2 месяца с нуля RAG систему построил, или Парсинг PDF по-хардкору #почитать Сегодня я расскажу о том, как я за 2 месяца с полного нуля создал доменную RAG систему с корпусом в 20+ книг. В статье затрону проблемы парсинга данных (особенно PDF документов, с которыми приходилось иметь дело), чанкинга, создания и индексации эмбеддингов, а также самого интересного – ретривера. Расскажу о latency, трейд-оффах, и сложностях реализации подобных систем локально на ноутбуке (хоть и «игровом») без использования API LLM. Вся система делалась мной самостоятельно без использования LangChain – это чистый пайплайн от Tesseract, Pillow, MuPDF/Fitz до e5-multilingual, FAISS (+bm25, который я затрону в статье) и Qwen3:8B в качестве LLM. ✅Читать статью2,75%
  • 24 июл.Почему AutoML не «магия», а способ выжить в промышленном ML #почитать Когда в компании появляется первая ML‑модель, кажется, что самое сложное выбрать алгоритм и добиться хороших метрик. Но настоящий вызов начинается позже: когда моделей становится десятки, затем сотни, а скорость бизнеса начинает требовать обновлений не раз в год, а раз в недели. В Страховом Доме ВСК мы довольно быстро поняли: без стандартизации и автоматизации машинного обучения масштабирование превращается в хаос. Так у нас появился собственный AutoML‑фреймворк как ответ на реальные боли промышленного ML. ✅Читать статью2,59%
  • 14 июл.Поиск аномалий: статистика или ML? Выбираем лучшее #почитать Поиск аномалий под микроскопом: от базовой статистики до робастных моделей с нуля на NumPy В машинном обучении поиск аномалий (Anomaly Detection) часто остается в тени классического обучения с учителем. Однако именно эта «иммунная система» данных спасает миллионы долларов в финтехе, предотвращает катастрофы на производстве и находит критические ошибки в медицинских картах. В этой статье мы не просто импортируем готовые методы из sklearn. Мы разберем математическую логику трех мощных подходов, напишем их «примитивные» реализации на NumPy/Pandas, чтобы понять механику работы «под капотом», и проверим их в деле на реальном кейсе. Наш полигон: Credit Card Fraud Detection Для тестов мы возьмем классический датасет Credit Card Fraud Detection. Это идеальный пример «иголки в стоге сена»: здесь всего 0.17% мошеннических транзакций среди почти 300 тысяч записей. Смогут ли наши рукотворные алгоритмы их найти? ✅Читать статью2,40%
  • 30 июл.Как мы научились определять продвинутые автоответчики #почитать Год назад мы начали использовать ASR для обработки записей телефонных звонков. TL;DR: вместо бинарных правил и end-to-end ML мы выбрали скоринговую систему поверх ASR (T-One): анализируем диалог и поведение, получаем ~98% точности при среднем времени обработки ~4.9 сек вместо 20+ сек на Whisper. Задача казалась простой: понять, ответил ли абонент сам или сработал автоответчик, и на основании этого корректно завершить звонок и вернуть деньги пользователю при неудаче. На практике всё оказалось сильно сложнее. ✅Читать статью2,40%
  • 20 июл.Архитектура «Обратного Хэша»: Нейросети без умножения #почитать Современный Deep Learning уперся в производительность вычислений с плавающей точкой (float) и пропускную способность памяти. Мы предлагаем архитектуру «Обратного Хэша», где нейрон — это не сумма произведений, а битовая функция. Ноль умножений. Ноль сложений. Только логика (XOR), статистика и скорость света. ✅Читать статью2,39%
  • 7 июл.⚠️Хотите разобраться, как обучать интеллектуальных агентов в нестандартных задачах для бизнеса? Начните обучение на курсе «Reinforcement Learning». 🎁Записывайтесь на 3 бесплатных вебинара — познакомьтесь с программой обучения и преподавателями. Задайте свои вопросы экспертам! Вебинар 1: «Обучение с подкреплением - гибкий подход для сложных задач. Создаем собственные окружения». ⏰7 июля в 20:00 мск Программа вебинара: 1. Краткое введение в обучение с подкреплением. 2. Обзор существующих сред и переход к созданию собственного RL-окружения на Python. 3. Напишем свою среду на основе gym.Env и подключим к ней обучающегося агента. Вебинар 2: «Visual DQN: Как научить ИИ-модель видеть мир глазами игрока». ⏰15 июля в 20:00 мск Программа вебинара: 1. Разберем, как DQN работает с изображениями: как агент получает состояние не в виде чисел, а в виде сырых пикселей с экрана. 2. Изучим архитектуру DeepMind-подхода. 3. Запустим обучение DQN в среде Atari Pinball и посмотрим, как агент постепенно учится играть лучше человека. Вебинар 3: «Алгоритм DQN - учим нейросеть принимать решение без помощи человека». ⏰21 июля в 20:00 мск Программа вебинара: 1. Разберем устройство алгоритма DQN: как нейросеть заменяет Q-таблицу и учится выбирать лучшие действия. 2. Изучим ключевые механизмы DQN. 3. Обучим агента решать задачу в среде Gymnasium и проанализируем процесс обучения. Записывайтесь ➡️ https://vk.cc/cZn70D Реклама. ООО «Отус онлайн-образование», ОГРН 11777466185762,38%
  • 3 мар.без подписи2,24%
  • 16 июн.Лидеры по работе с данными и ИИ из Альфа-Банка, Сбера, X5 Tech, Т-Банка, Ozon Fintech, Банка России, Дикси, Ситидрайва, Lamoda, Черкизово и других компаний расскажут, как данные и искусственный интеллект помогают ускорять бизнес в финтехе, ритейле, промышленности, транспорте и агросекторе. 9 июля на форуме Data Day 2026: 💰 Тренды AI и данных «из первых уст». На какие технологии и подходы делают ставку лидеры рынка? 💰 Как превратить хаос данных в надежный бизнес-навигатор и сделать данные стратегическим активом компании. 💰 Практика внедрения AI и data-driven подходов в финтехе, ритейле, логистике, промышленности и агросекторе. 💰 Как находить новые точки роста, используя опыт цифровых лидеров и сильные data-команды. 💰 AI-hub: выставка и центр экспертизы готовых AI-решений и автономных агентов для бизнеса. Выступают: – Руслан Булатов, Банк России. Директор Департамента финансовых технологий. – Дмитрий Криволапов, Lamoda. Директор департамента по данным и аналитике. – Алексей Бондаренко, Газпромбанк. Вице-президент — начальник департамента управления данными. – Дмитрий Рузанов, Альфа-Банк. Директор департамента разработки моделей. – Павел Денисенко, X5 Tech. Директор департамента развития платформы больших данных. – Артём Летин, ВТБ. Начальник управления моделирования КИБ и СМБ, вице-президент. – Валерий Поляков, Т-Банк. Лидер по данным группы Т-Технологии (Chief Data Officer). – Александр Лукьянов, ДОМ РФ Технологии. Генеральный директор. – Валентина Рудик, Ozon Fintech. Руководитель розничного кредитования. – Андрей Скачёк, М.Видео, Директор по маркетингу И другие. Вас ждет самый масштабный Data Day: 🔥 5 отраслевых треков (Финтех, Агропром, Путешествия и Транспорт, Ритейл, Персональная эффективность) 🔥 1500+ участников 🔥 60+ спикеров 9 июля, «Бизнес. Техноград», ВДНХ, Москва. Присоединяйтесь! Форум соберет экспертов по данным и AI из банков, ритейла, телекома, транспорта, агропрома, ИТ-компаний и индустриальных лидеров. 👉 Программа и регистрация Реклама. ООО «Регламент». ИНН 7708323273. erid:2W5zFJJ3D6q2,05%
  • 6 мар.без подписи2,04%
  • 10 июл.50 LLM-клеток пытались построить организм. Вот что получилось #почитать Что если заменить клетки из «Игры в Жизнь» Конвея на крошечные нейросети? Я провел эксперимент: выдал каждой клетке свой «мозг» — LittleLM весом всего 6 килобайт — и заставил их договариваться друг с другом. Вдохновившись опытами биолога Майкла Левина, я попытался вырастить цифровой организм из 50 автономных агентов. В результате они не только построили структуру без единого центра управления, но и изобрели «рак». ✅Читать статью2,03%
  • 27 февр.без подписи1,80%