tgindex
BigData Team (BDT)

BigData Team (BDT)

Статистика
@bigdatateamрусский

BigData Team: the way you learn best Практико-ориентированное обучение по Big Data, Machine Learning, промышленной разработке на Python. https://bigdatateam.org/ru Чтобы бустнуть: https://t.me/boost/bigdatateam

Последний пост
14 авг.
Последнее чтение
13 авг.
Постов за неделю
2
Всего постов
28
Тип
открытый
Язык
русский
В каталоге с
13 авг.
Подписчики
784
0 за 3 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
229
28 постов
Вовлечённость
29,2%
к подписчикам
Постов в день
0,3
всего 28
Упоминаний
1
каналов
Охват размещения
оценка
1/24сутки в ленте
99
1/48двое суток
113
1/72трое суток
122

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • видео или голосовое, без подписи

  • 🧐 График построен. А вывод где? рубрика pro #ml Смотрим проект на курсе. Ноутбук образцовый: Learning Curves аккуратные, разложение bias-variance нарисовано, оси подписаны, код отработал без единой красной ячейки. Спрашиваем автора: "ну и какую модель в прод?" Пауза. Ноутбук заканчивается картинкой, и ответа в нём нет. А ведь самое ценное начинается ровно там, где оборвалась последняя ячейка. Кривые честно показывают over- и underfitting, но сами за себя не говорят: почему одна модель переобучается раньше другой и какую в итоге выбрать. Объяснить это ценнее, чем построить график: картинку рисует код, а понимание видно по выводу под ней. Где под графиком чаще всего пусто: 1️⃣ Learning Curves без вывода Даже одна кривая отвечает на главные вопросы: переобучается модель или нет, помогут ли ещё данные. Только ответы эти нужно записать: дальше в том же проекте на них опирается весь подбор параметров. Промолчали — и подбираете вслепую. 2️⃣ Bias-variance без сравнения Почему бэггинг снижает дисперсию, можно объяснить и без графика. График строят ради другого: увидеть эффект на своих данных и поставить рядом две картинки, одиночное дерево против бэггинга. Обе нарисованы, а сравнения под ними нет. 3️⃣ Сравнение без вердикта Optuna против Grid и Random Search: сравнение прогнали, таблица с результатами готова. Не хватает одной фразы под ней: какой способ подбора берём дальше и почему. Без неё Optuna и перебор так и остаются двумя строчками в таблице, а не решением. 🚭 Полезные привычки курильщика ML'щика Под каждым графиком: одно-два предложения о том, что на нём видно и какой выбор из этого следует. Проверка простая: закройте картинку и перечитайте текст. Если по нему восстанавливается решение (какая модель, почему именно она), вывод есть. Если остаётся "см. график выше", вывода нет. График — это аргумент, а не результат. Он как рентгеновский снимок: снимок сделает и аппарат, а диагноз ставит тот, кто умеет его прочитать. И на защите проекта, и на ревью в команде вопрос к вам будет один и тот же: не "как вы это построили", а "почему вы это выбрали". Привычка выше готовит ответ заранее. Правильный код — это ещё не правильная методология. Заглядывайте к нам на практику: здесь каждый график доводим до вывода, а каждый вывод — до выбора модели. 🗓 Ближайший поток запланирован на 7 сентября BigData Team: the way you learn best BD/ML Engineer | AI Agents Engineer 🆕🔥 Py4BDA | Python | Machine Learning | Big Data #study #ml #MachineLearning #DataScience

  • 7 авг.174122

    🔬 Уровень AI adoption, независимое исследование credit за находку: Денис С. // выпускник практических курсов BigData Team С вас - лайки 😉 BigData Team: the way you learn best BD/ML Engineer | AI Agents Engineer 🆕🔥 Py4BDA | Python | Machine Learning | Big Data #meme #AgenticCoding #BigDataTeam

  • 2 авг.234132

    🎛 Тюнинг, который ничего не тюнит рубрика pro #ml Знакомая сцена с разбора практических проектов: человек честно перебрал гиперпараметры бустинга, пометил ячейку "затюнено" и идёт дальше. А на отложенном тесте после всего перебора ничего не изменилось: default давал 0.87 ROC-AUC, "затюненная" — те же 0.87. Столько усилий, чтобы остаться ровно там же. И вот где прячется тихая ловушка. Тюнинг ощущается как работа: покрутил ручки, посмотрел на числа, устал — вроде молодец. Но засчитывается он не по усилиям, а по табло held-out: если подобранная модель не бьёт дефолтную на отложенной выборке, в прод едет default, а перебор отправляется в стол. Смысл ведь не в том, чтобы нажать кнопку и вызвать метод, а в том, чтобы понять, стало ли реально лучше. Тюнинг ради тюнинга — это как учёба ради учёбы: движения есть, смысла нет. На учебном проекте это видно яснее всего: за цифры тут не переспросит ни начальник, ни старший, никто, кроме вас самих. Где это всплывает чаще всего: 1️⃣ "Затюнено", а метрика на месте модель помечена как подобранная, но на тесте метрика не выросла или даже просела относительно default. Перебор был, прироста нет. 2️⃣ Ручной перебор без кросс-валидации параметры подобраны несколькими ручными попытками на одной отложенной выборке. Несколько точек нестабильны: удачная конфигурация легко оказывается случайной, а не реальным свойством модели. 3️⃣ Таблица default vs tuned "на глаз" сравнение собрано с приблизительными числами вместо реально посчитанной метрики. Доказать прирост тогда попросту нечем. 🚭 Полезные привычки курильщика ML'щика Тюнинг — это гипотеза "стало лучше", а не медаль за старания. Гоняем её кросс-валидацией на train (RandomizedSearchCV, GridSearchCV или Optuna), а не одной удачной ручной попыткой, и кладём рядом два честных числа: метрику до и после. Вырос held-out — прирост едет в прод; не вырос — остаётся default. Отрицательный результат на held-out — тоже результат, причём честный, и о нём стоит рассказать: это экономит время тем, кто иначе полез бы в тот же тупик. В индустрии за честно закрытый неудачный эксперимент спасибо скажут не меньше, чем за удачный — так что привычки выше пригодятся и джуну, и любому синьору-помидору. Плохо не когда тюнинг не помог, плохо — когда его всё равно записали в победы. Заглядывайте к нам на практику, где тюнинг засчитан только приростом на held-out. 🗓 Ближайший поток запланирован на 7 сентября BigData Team: the way you learn best BD/ML Engineer | AI Agents Engineer 🆕🔥 Py4BDA | Python | Machine Learning | Big Data #study #ml #MachineLearning #DataScience

  • ❤️‍🩹 Будни ИИ-стартапов credit за находку: Денис Л. // CPO образовательных курсов BigData Team Прислать ваш мем в конкурс мемасиков можно в личку этого канала. Всем хороших выходных и не забываем ставить лайки, авторам будет приятно. Перевод и upscale: Gemini (сравниваем и улыбаемся). BigData Team: the way you learn best BD/ML Engineer | AI Agents Engineer 🆕🔥 Py4BDA | Python | Machine Learning | Big Data #meme #AgenticCoding #BigDataTeam

  • 💤 Идеальный код, который никто не запускал рубрика pro #ml Открываешь присланный ноутбук: код чистый, структура на месте, комментарии по делу. Листаешь вниз, а у каждой ячейки пусто. In [ ]:, ни одного вывода, execution_count = 0. Модель описана, обучение написано, метрика где-то в тексте даже заявлена. Только всё это ни разу не прогонялось. Мысль тут простая до обидного: непрогнанный код — это ещё не результат, а только заявка на него. Пока ячейка не выполнена, судить особо не о чем: неизвестно, обучается ли модель, сходится ли лосс, чему на самом деле равна метрика. Тихие ошибки любят прятаться именно здесь: несовпадение форм тензоров, не то устройство, внезапный OOM. Вылезают они ровно в момент запуска, а не раньше. Где это ловится чаще всего: 1️⃣ Ноутбук не прогнан начисто сверху вниз код эволюционирует: ячейки перезапускают, меняют местами, счётчик исполнения скачет — In [7] стоит выше In [3]. Воспроизводится ли такой прогон с нуля — уже большой вопрос. А нередко выводов и вовсе нет: ни логов обучения, ни метрик, ни графиков. Для генеративных задач та же беда: ни кривых лосса, ни реконструкций, ни единого сгенерированного сэмпла. Засчитать тут можно разве что аккуратную структуру, но не результат. 2️⃣ Метрика есть, но не в выводе финальная цифра вписана в markdown или в комментарий руками, а не посчитана в исполненной ячейке. А раз в выводе её нет — такую метрику нельзя ни проверить, ни воспроизвести. 🚭 Полезные привычки курильщика ML'щика Restart & Run All перед сдачей, а потом глазами пройтись сверху вниз: у каждой ячейки есть вывод, а финальная метрика стоит в выводе ячейки, а не вписана в markdown руками. Код без прогона — как рецепт, который вы так и не приготовили: на бумаге пальчики оближешь, а на деле... В ML верят не тому, что написано, а тому, что выполнилось: пустые In [ ]: — это не "почти сдал", а ноль доказательств. Заглядывайте к нам на практику, здесь мы хорошие привычки доводим до автоматизма. 🗓 Ближайший поток запланирован на 7 сентября BigData Team: the way you learn best BD/ML Engineer | AI Agents Engineer 🆕🔥 Py4BDA | Python | Machine Learning | Big Data #study #ml #MachineLearning #DataScience

  • 🔞 Три самых главных слова этого лета credit за находку: Евгений Адищев // CDO и преподаватель образовательных курсов BigData Team Прислать ваш мем в конкурс мемасиков можно в личку этого канала. P.S. всем хороших выходных и не забываем ставить лайки, авторам будет приятно. BigData Team: the way you learn best BD/ML Engineer | AI Agents Engineer 🆕🔥 Py4BDA | Python | Machine Learning | Big Data #meme #AgenticCoding #BigDataTeam

  • 📊 Метрика, на которую вы не смотрите рубрика pro #ml В отчёте студента стоит F1 = 0.91. Ноутбук воспроизводится, в тест нигде не подсматривали, придраться вроде не к чему. И всё равно в проде такая модель будет тихо ошибаться ровно там, где это дороже всего. Никакой утечки здесь нет, цифра настоящая. Просто это не та цифра. F1 посчитан с weighted-усреднением, а классы перекошены, скажем, 1 к 20. Тогда красивая метрика собрана в основном по большому классу, а редкий позитив, ради которого всё и затевалось, в ней почти не виден. Это средняя температура по больнице: одно число усреднило и здоровых, и того единственного, кто по-настоящему болен. А боятся обычно именно его: пропущенный мошенник, несработавший алерт по оттоку, незамеченный дефект. Где метрика говорит не то, что вы думаете: 1️⃣ F1 с weighted/macro на дисбалансе Бинарная задача, а F1 считается с average='weighted' или 'macro' — и доля пропущенных позитивов (False Negative) растворяется в среднем. Берите binary F1 по положительному классу: average='binary', label=1. 2️⃣ ROC-AUC через multiclass ovr в бинарной задаче Таргет остался четырёхклассовым, а решаете вы бинарную. AUC по multiclass ovr искажён и несравним с честным бинарным. Пример: схлопнули 4 класса в "дефолт / не дефолт", но AUC считаете по всем четырём через ovr — выходит 0.94; честный бинарный AUC по вероятности дефолта — 0.78. Бизнесу обещали 0.94, он увидит 0.78. Приведите таргет к бинарному и считайте AUC по вероятности положительного класса. 🚭 Полезные привычки курильщика ML'щика Сначала решите, что для вас значит "ошибиться", и только потом выбирайте метрику под это. На дисбалансе считайте отдельно по классу, который вам дорог, и печатайте число явно, а не прячьте под усреднением. Одна строчка в шапке отчёта не должна усреднять тех, кого усреднять нельзя. Высокий F1 — это ещё не хорошая модель. Иногда это просто удобный способ не заметить, что редкий класс вы стабильно теряете. Хотите научиться выбирать метрику под задачу, а не подгонять задачу под красивую цифру? Берите на заметку и заглядывайте к нам на практику: 👉 Практический курс по Machine Learning 🗓 Ближайший поток запланирован на 7 сентября BigData Team: the way you learn best BD/ML Engineer | AI Agents Engineer 🆕🔥 Py4BDA | Python | Machine Learning | Big Data #study #ml #MachineLearning #DataScience

  • 🐱 ИИ: ожидание vs реальность credit за находку: Алексей Драль // методист образовательных курсов BigData Team перевод на русский и upscale: Chat GPT 🏆 С вас - лайки 😉 P.S. всем хороших выходных BigData Team: the way you learn best BD/ML Engineer | AI Agents Engineer 🆕🔥 Py4BDA | Python | Machine Learning | Big Data #meme #AgenticCoding #BigDataTeam

  • 🙀 "У меня 0.95 AUC!" — и почему это страшно рубрика pro #ml Проверяли недавно проекты студентов Практического курса по Machine Learning. И снова одни и те же грабли: модель с почти идеальной метрикой, которая в реальности развалится на первом же новом батче. Классика, в которую попадал каждый практик. Причин может быть несколько, сегодня мы разберем data leakage ("протечка" или утечка данных). Суть до обидного простая: где-то по дороге модель подсмотрела ответы. Причём почти всегда из лучших побуждений. "Давайте отмасштабируем данные перед сплитом", "добавим eval_set, чтобы вовремя остановиться". А потом метрика на тесте красивая ровно потому, что тест уже, по сути, поучаствовал в обучении. Где ловим это чаще всего: 1️⃣ Scaler или Target Encoding, посчитанные по всему датасету до train/test split 2️⃣ бустинг, которому скормили eval_set=(X_test, y_test), и ранняя остановка тихо подстроилась под тест 3️⃣ блендинг, где веса ансамбля подбирали прямо по тестовым меткам Лечится одной привычкой: относиться к тесту как к заначке на чёрный день. Достали один раз, в самом конце, посмотрели и убрали. Вся предобработка, что зависит от данных, живёт внутри пайплайна и учится только на train. На кросс-валидации считаем то же самое только внутри фолдов, без исключений. И если метрика подозрительно хороша, это не повод открывать шампанское, а повод пойти поискать, где вы случайно показали модели правильные ответы. Обычно находится. Хотите довести весь ML-пайплайн до автоматизма и не наступать на такие грабли? Берите кейсы на заметку, подписывайтесь или заглядывайте к нам на практику: 👉 Практический курс по Machine Learning 🗓 Ближайший поток запланирован на 7 сентября BigData Team: the way you learn best BD/ML Engineer | AI Agents Engineer Py4BDA | Python | Machine Learning | Big Data #study #ml #MachineLearning #DataScience

  • 🤯 Как разработчики используют агентскую разработку credit за находку: Денис С. // выпускник практических курсов BigData Team С вас - лайки 😉 BigData Team: the way you learn best BD/ML Engineer | AI Agents Engineer Py4BDA | Python | Machine Learning | Big Data #meme #AgenticCoding #BigDataTeam

  • 5 июл.266123

    ✍️ Data Science (ч.1..10) и как расти дальше рубрика pro #ml Каждый поток одно и то же: человек обучает первую модель, видит accuracy под 100% и уже мысленно правит резюме. А мы молчим и ждём — потому что знаем, что будет через неделю, когда эта сотка красиво развалится на новых данных. Вот в этом зазоре между "получилось" и "а почему получилось" и живёт весь Data Science. Держите 10 полезных шагов в ML. Сохраняйте себе и пересылайте тому, кто тоже метит в Data Science: — ч.1 введение в ML и библиотеки ML для Python — ч.2 оценка качества работы алгоритмов и learning curves — ч.3 визуализация в анализе данных — ч.4 разведочный анализ данных и статистические интеграции — ч.5 оптимизация ML алгоритмов — ч.6 Hello, world в мире ML и алгоритм kNN — ч.7 презентация результатов в ML — ч.8 эксперименты с простыми алгоритмами ML — ч.9 что нужно знать при работе с деревьями — ч.10 вероятностные алгоритмы и наивный Байес На выходе — не обученная модель, а умение идти вглубь: диагностировать по learning curves, калибровать, выбирать куда развивать модели и решения. Это и есть фундамент — то, что отличает инженера от "fit-predict и готово". И на этом же фундаменте мы в BigData Team строим следующее — агентскую разработку. Это когда ИИ-агенты помогают делать разработку, DevOps и аналитику в 5–10 раз быстрее, а держится всё на вашем фундаменте: ML, данные, инженерия. Пользоваться агентами может научиться каждый; выжать из них инженерный результат — только тот, под кем есть этот фундамент. Записаться на фундаментальные курсы: 👉 Практический курс по Machine Learning 👉 AI Agents Engineer — от агентской разработки до ИИ-агентов Мы остановились на 10-й не потому что тема закрыта, а чтобы свериться с вами. Emoji голосование. Куда копаем дальше? 👍 грабли в ML: типичные ошибки из проектной деятельности выпускников наших обучений 🔥 глубже в ML: SVM, нейросети, калибровка ❤️‍🔥 агентская разработка 🤔 своя тема, напишу в комментариях ✍️ Сохраните и подпишитесь, если хотите быть востребованным в IT P.S. Новую специализацию AI Agents Engineer (на фундаменте ML / Big Data / DevOps) запускаем осенью. BigData Team: the way you learn best BD/ML Engineer | AI Agents Engineer Py4BDA | Python | Machine Learning | Big Data #study #ml #DataScience #BigDataTeam

  • 🫀 Вся правда об агентской разработке Недалекое будущее, зато честно. А если по делу, то вам сюда. BigData Team: the way you learn best Py4BDA | Python | Machine Learning | Big Data | BD/ML Engineer #meme #AgenticCoding #BigDataTeam

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • ✍️ Готовимся к работе в Data Science, pro #ml (ч.10) После знакомства с семействами метрических и логических классификаторов самое время закрыть гештальт по работе с вероятностными алгоритмами. Самый яркий представитель данного семейства: наивный Байесовский классификатор. На собеседовании вас обязательно спросят: 1️⃣ Почему классификатор "наивный"? спойлер 2️⃣ Почему он Байесовский? Подсказки: 1. Байесовская статистика (Bayesian statistics) vs Частотная (классическая) статистика (Frequentist statistics) 2. Теорема Байеса 3️⃣ Как происходит обучение и как выглядит решающее правило? Изучите понятия правдоподобия, априорной и апостериорной вероятности. Теперь, когда теория разобрана, предлагаем перейти к практике. Задача 20 newsgroup Изучите датасет 20 newsgroups и научитесь с ним работать: from sklearn.datasets import fetch_20newsgroups Выберите пару (или больше) интересующих вас классов и оцените качество работы вероятностного алгоритма классификации из модуля: from sklearn import naive_bayes 1. Разберитесь каким именно образом текст превращается в численные характеристики и какое распределение используется под капотом. 2. Сравните качество с другими семействами алгоритмов. Смело присылайте ваши картинки и расследования в чат под катом. Задача "старый добрый гейзер" (Йеллоустоун) 1️⃣ Проведите разведочный анализ данных датасета на Kaggle. 2️⃣ Дополните красивыми визуализациями. 3️⃣ Выложите ваше расследование в формате ipynb, чтобы прокачать свой профиль на Kaggle. Также присылайте ссылку на ваше расследование, чтобы вдохновиться и полайкать 🤗 Last, but not least Как сказал британский ученый: в сущности, все модели неправильны, но некоторые полезны (c) Джордж Бокс. Любая модель описания мира — это приближение. Но их точности часто достаточно для решения поставленных предсказательных задач. Например, какое ваше следующее действие — позалипать в рилс, почитать новости или поучиться? 🚀 Что делать, если вы хотите двигаться еще быстрее — записаться на Практический курс по Machine Learning — пройти тестирование по ML — познакомиться с авторами курса Остались вопросы? Напишите нам в [WA / TG] Полезная информация Прошлые выпуски: — ч.1 введение в ML и библиотеки ML для Python — ч.2 оценка качества работы алгоритмов и learning curves — ч.3 визуализация в анализе данных — ч.4 разведочный анализ данных и статистические интеграции — ч.5 оптимизация ML алгоритмов — ч.6 Hello, world в мире ML и алгоритм kNN — ч.7 презентация результатов в ML — ч.8 эксперименты с простыми алгоритмами ML — ч.9 что нужно знать при работе с деревьями ✍️ Сохраните и подпишитесь, если хотите быть востребованным в IT BigData Team: the way you learn best Py4BDA | Python | Machine Learning | Big Data | BD/ML Engineer #study #BigDataTeam

  • 🤔 AI увеличивает производительность разработки? В каждой шутке есть доля шутки... BigData Team: the way you learn best Py4BDA | Python | Machine Learning | Big Data | BD/ML Engineer #meme

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

BigData Team (BDT) — tgindex