Analyst’s Notebook📖
описание
Жизнь аналитика: карьера, образование, хард и софт скиллы etc Автор: @glebgavrin
362
подписчиков
Охват к подписчикам
130,7%
ERR
Реакции к просмотрам
4,11%
389 на 20 постов
Пересылки к просмотрам
1,30%
123
Постов в день
0,0
всего 21
Где отзываются чаще
доля реакций к просмотрам- 25 июл.Карьерный поворот: часть 3 - итог 🎉 В первой и второй частях я рассказывал про решение сменить работу и процесс поиска. Итак, теперь я работаю мидл продуктовым аналитиком в VK, в аналитической команде VK ID 😊 Отбор ⬆️ На вакансию я откликнулся в мае. По этапам: -> 30 минут с HR (рассказал о себе, узнал о команде) -> Тех собес на 1.5 часа -> Финал с CPO VK ID На тех собесе все было примерно как я описывал в предыдущей части, удалось пройти его очень хорошо. Мне подробнее рассказали, чем занимается команда, и это совпало с моим видением оптимального пути развития сейчас, поэтому после собеса очень надеялся на приглашение на следующий этап. Мне понравилось, как составлен собес: многие задачи одновременно проверяли теоретические знания по экспериментам и умение быстро написать нужный код в sql/pandas. На финальном собесе я спросил, какие положительные факторы работы в этом департаменте и в целом в VK, и мое видение места, где мне будет комфортно и я смогу расти, совпало с тем, что рассказали. Первые впечатления о работе 👀 Я уже проработал 4 недели. Адаптация проходит легче, чем я ожидал, и это очень приятно. Я рад, что получаю опыт в B2C продукте, это очень расширяет аналитический кругозор. Мне очень нравится подход к планированию здесь. Каждая задача оценивается по временным затратам, что дает возможность следить за своей скоростью и менеджить задачи внутри недели. На предыдущем месте этому уделялось меньше внимания и к пятнице часто был завал и не идеальное эмоциональное состояние Также очень удобным инструментом оказался clickhouse, функции в нем очень гибкие и в целом все удобно и быстро. Сейчас есть понимание, что мне еще очень многому предстоит научиться, но уже есть неплохая база и я на правильном пути. Напишите, как у вас проходила адаптация в новых местах, было ли сложно Ставьте 🔥 если вам понравилась серия постов и ❤️ если ждете посты про новые проекты #карьера #жизнь_аналитика9,70%
- 6 авг.Адаптация на новом месте: люди, данные, продукт 📍 Я не так давно сменил работу, но уже успел зафиксировать основные моменты, на которые стоит обращать внимание при адаптации. Мы с Ильей обменялись наблюдениями и подготовили для вас наши выводы. Обязательно загляните и почитайте про его опыт Погружение в продукт 🤿 Чтобы погрузиться, я: - Прошел пользовательский путь: свежий взгляд помогает заметить неочевидные неудобства и связать данные с реальным опытом пользователя - Разобрался с метриками: можно посмотреть дерево метрик, узнать на какие метрики ориентировались раньше и на какие сейчас - Узнал стратегию на год/квартал: это помогает расширить взгляд на бизнес и понять, куда движется команда. Можно посмотреть презентации или сходить на стратегические встречи Погружение в данные 📊 Вот что я бы точно рекомендовал, на основании своего опыта: - Потратьте время на структуру таблиц, связи между ними, смысл ключевых атрибутов. Чаще всего коллеги сами в первые недели помогают понять такие моменты, но чтобы закрепить, можно поизучать и самому - Точно стоит поискать и разобрать неочевидные кейсы (где могут быть и как заполняются пропуски, где может быть дубликат и т.п.). Про это есть отдельный пост - Изучение графиков и скриптов, на которых они строятся, помогает понять, как рассчитываются основные метрики и какая у них динамика, что можно считать аномалией Погружение в коллектив 👫 Тут все достаточно банально - важно познакомиться со всеми, не стесняться задавать вопросы. Как правило в первые месяцы от вас не будут ждать идеальной скорости выполнения, оптимального подхода. Важно просто работать в свою силу и не переживать, но быть внимательным к деталям, которых поначалу может быть очень много. Мне лично удобен оказался такой формат: получил задачу, поизучал ее, и либо написал вопросы понимающему контекст коллеге вопросы текстом, либо поставил получасовую встречу. При этом что касается данных, иногда стоит уделить время и попытаться вникнуть самому, но без фанатизма. Буду рад почитать про ваш опыт адаптации в комментариях Заходите к Илье - у него на канале можно найти много интересных инсайтов из мира DS Ставьте🔥, если понравилась коллаборация и ❤️ если согласны с нашими рекомендациями9,33%
- 15 июл.Карьерный поворот: часть 1 - предыстория 😜 Последние несколько недель были непростыми - нужно было передать свои проекты коллегам на прошлой работе и влиться в новые процессы. Сегодня расскажу вам про причины перехода, а в следующих частях про поиск работы, переход и первые ощущения от нового места. Почему я решил искать новую работу? 🤔 В конце прошлого года я много думал о том, как я хочу строить карьеру в ближайшие годы. При этом в Сбере у меня был достаточно широкий диапазон задач, и сложно было отнести меня четко к дата- или продуктовым аналитикам. Плюс в моем направлении из-за специфики продуктов сложно было проводить эксперименты, что оказалось важным фактором для меня. От многих людей из комьюнити я слышал мнение, что самое интересное, что есть в аналитике - это эксперименты во всех их проявлениях. Я во многом согласен с этим, есть ощущение, что тут точно есть что изучать, куда расти, не виден потолок. Тогда я решил, что хочу перейти в продуктовую аналитику. На моем этапе важно получить практический опыт в онлайн экспериментах и продуктовых исследованиях, научиться оптимально выстраивать дизайн экспериментов. Также важным для меня было понимание, что в долгосроке мне больше интересны B2C, чем B2B продукты. Мне интересно исследовать пользовательский путь, да и простор для гипотез здесь больше. Продуктовые аналитики в постоянном контакте с менеджерами продуктов, что определенно развивает бизнес мышление и дает возможность посмотреть на проблемы продукта и пользователей под разными углами. Я считаю это очень ценным, особенно для тех, у кого есть желание когда-то построить собственный бизнес. Плюс здесь видно влияние твоей работы на удобство пользователей, что меня очень вдохновляет. Не безразличен мне был и формат работы. В моем департаменте в Сбере было невозможно даже пару дней в неделю работать удаленно, а я хотел гибридный или удаленный формат. В следующем посте расскажу про отклики, собеседования, покажу свое резюме. Пишите в комментариях, что думаете по такому формату постов и в целом ваши мысли🙃 Ставьте ❤️ если понравился пост и 🔥 если ждали новые посты #карьера #жизнь_аналитика8,38%
- 19 июл.Карьерный поворот: часть 2 - поиск 👌 Обязательно прочитайте первую часть, если не видели. Где я искал вакансии? 💬 Лучшим источником вакансий сейчас я считаю тг каналы. Туда дублируется абсолютное большинство вакансий с LinkedIn и сайтов компаний. Подписавшись на 3-4 канала можно покрыть ~99% рынка. Воронка 🪣 Поиском работы я занялся в феврале. Предпочтений по конкретным компаниям у меня не было, но в первую очередь рассматривал бигтехи и банки. У меня не было большого опыта в прохождении тех собесов, поэтому я откликался на вакансии не только продуктовых, но и на дата аналитиков, чтобы потренироваться проходить собесы да и в целом посмотреть на рынок. Откликался я на мидл и джун+ вакансии. Поначалу я откликался со старым резюме и конверсия в тех собес была низкой. Потом я решил переписать резюме, сделав акценты на работе с продуктом и ценных результатах проектов. Это принесло свои плоды и конверсия в собеседования выросла. В итоге за ~3.5 месяца я прошел 7 тех собесов. Благодаря этому я научился лучше решать продуктовые кейсы, прокачал проблемные теоретические темы и самопрезентацию. Всем кто ищет работу рекомендую проходить как можно больше собеседований, это реально полезно. На последних собесах я уже показывал себя очень достойно в плане проф знаний и в целом был уверен в себе. Что было на собесах? 👀 Лайвкодинг присутствовал на всех моих тех собесах. SQL был в 100% случаев, Python чуть реже. Задачи на sql были очень похожи на всех собесах: если используете sql в работе и не будете сильно волноваться - хорошо справитесь. По Python (если до собеса не заявлено, что будут алгоритмы 🤩🫠) все тоже достаточно тривиально: чаще всего спрашивают синтаксис, pandas + numpy + scipy и умение сделать быстрый EDA анализ. На позиции продуктовых аналитиков всегда есть вопросы по теории A/B тестирования. В основном спрашивают теорию классических А/Б, но тут зависит от места. В конце обычно дают кейс, где нужно разобрать проблему, предложить варианты решения, задизайнить эксперимент и подвести итоги. Очень важный этап, так как здесь собеседующие хотят понять, имеет ли кандидат продуктовый майндсет. Важно не забыть про бизнес аспекты, заградительные метрики и прочие подобные моменты. Кейс обычно связан с деятельностью команды, так что тут можно неплохо подготовиться, если заранее поспращивать hr о команде и продукте. Лайфхаки и рекомендации 👍 Из каждого утюга сейчас говорят о том, насколько изменился рынок труда и как трудно найти работу в аналитике/ds. Мои ощущения по итогам этого поиска такие: если действительно разбираться в своей области, найти желанную работу можно, хоть и займет это скорее всего побольше сил и времени, чем в условном 2023. Конкуренция однозначно выросла, но благодаря этому и мы с вами можем стать сильнее) Вот что я бы порекомендовал: 1️⃣ Уделите внимание составлению резюме. Фокус на достижениях и экспертизе. Если не имеете опыта в конкретной области или не работали с похожими продуктами - ищите пересечения. В комментариях к посту можете увидеть мое резюме, давшее неплохую конверсию. 2️⃣ Готовьтесь к каждому собеседованию. Если поресерчить метрики продукта, будет намного проще решить кейс. С подготовкой списка теор вопросов неплохо справляются нейронки, если дать контекст. 3️⃣ Подготовьте рассказ о себе. Он должен быть кратким и по делу, я делал фокус на опыте работы и своих результатах. Образование и курсы тоже можно упомянуть, если они релевантные. Про все остальное лучше рассказать если спросят. 4️⃣ Верьте в себя. Не бойтесь откликаться, даже если не хватает экспертизы или, например, нескольких месяцев опыта. Требования в вакансиях - ориентир. Куда важнее как кандидат пройдет собеседование и насколько он умеет приносить результат. Волнение трудно нейтрализовать полностью, но на собесе нужно стараться концентрироваться чисто на текущем вопросе. Больше опыт прохождения собесов = меньше волнение. В следующем посте расскажу, куда я в итоге прошел и чем занимаюсь. Ставьте 🔥 если мой опыт полезен для вас и 🤩 если согласны с моими рекомендациями #карьера #жизнь_аналитика8,21%
- 1 авг.Где брать данные? ❓ Для пет проектов, учебы, исследований могут понадобиться датасеты различного объема и содержания. Решил собрать подборку источников данных на все случаи жизни Kaggle 🔤 Огромный пул датасетов, сложно придумать тему, по которой тут не найдется данных. Все легко и быстро выгружается. Есть обсуждения и, если датасет популярен, множество работ на его основе: от базового анализа до сложных моделей. Минус kaggle как источника датасетов для меня в их чистоте. На реальной работе приходится работать с пропусками, ошибками в данных и т.п. Здесь же, как правило, все чисто и красиво, поэтому не развивается скилл делать миллион проверок перед анализом Архивы и опросы 🗂 На мой взгляд такие данные хороши для эконометрических исследований. Вот несколько таких источников: - РМЭЗ: мониторинг экономического положения и здоровья домохозяйств от ВШЭ - ESS: европейское социальное исследование - WVS: исследование с данными по всем странам мира Иногда такие данные требуют хорошей предобработки, бывает что документация к ним непонятная Специализированные сайты 🌐 Хорошая альтернатива kaggle. - Google dataset search: ищет датасеты по всему интернету - UCI: хороший источник датасетов для ml задач - FiveThirtyEight: проект дата журналистов с множеством крутейших датасетов Парсинг 👨💻 Здесь у меня нет большого опыта, но для специализированных данных (например, данные по стоимости и параметрам квартир в Хабаровске) это может быть единственным вариантом Генерация данных 🧱 В некоторых случаях это лучший вариант. Нейронки неплохо справляются с написанием кода для генерации данных, особенно если качественно написать промпт. Например, для поста про корреляционный анализ, я генерировал датасет Сохраняйте подборку и пишите, какие подборки еще хотели бы увидеть здесь 👀 Ставьте 🔥 если было полезно и ❤️ если используете такие же источники #анализ_данных #подборка5,83%
- 7 апр.Data-driven подход в повседневной жизни: мои открытия 🍆🏃♂️ В последнее время я стал задумываться, есть ли для моей повседневной жизни какая-то польза от того, что я работаю с данными. Как мне кажется, у всех специалистов в области ds (аналитиков, эконометристов, ml инженеров) есть схожие навыки и преимущества, не связанные напрямую с работой / изучением наук о данных. Сегодня расскажу о своих привычках / подходах, которые появились благодаря работе с данными. Надеюсь, благодаря посту вы сможете переосмыслить некоторые свои навыки и научиться видеть их применение в абсолютно разных сферах жизни. А продолжение, как и множество другой полезной информации о работе в ds можете найти в канале Саши. Проверка гипотез вместо интуитивных решений 🤔 В абсолютном большинстве случаев компании не внедряют что-либо, не проведя эксперимент на малом количестве пользователей. Такой подход можно успешно перенести на свою жизнь. Например, я заметил, что влияние кофе на мою продуктивность неоднозначное и есть подозрение, что энергия сильно снижается через 1.5-2 часа после кофе. Я провел эксперимент: 1 неделю пил 1 чашку кофе днем и отмечал в таблице, насколько я энергичен через 20 минут и через 2 часа после кофе по шкале от 1 до 10. На следующей неделе не пил кофе днем и также заносил уровень энергии в таблицу. Благодаря этим наблюдениям я понял, что кофе повышает мою производительность на коротком отрезке (до часа), а потом силы резко пропадают. Поэтому теперь я пью кофе только если нужно сделать финальный рывок. Умение доносить информацию 🗣 Бизнес ждет от аналитиков инсайты и полезные выводы, а промежуточные результаты и сам процесс анализа как правило не вызывает интереса. Аналитики на работе обретают навык выбирать самую ценную информацию и доносить ее так, чтобы она воспринималась непогруженными в методы анализа людьми и они сразу видели ответы на 2 ключевых вопроса: Какую пользу нам это принесет? Как нам это реализовать? Этот навык очень ценен для любого дела, не только работы. Например, при организации совместного досуга с друзьями я стал тратить меньше времени на рассуждения. Просто предлагаю наиболее релевантные на мой взгляд варианты и четко озвучиваю преимущества каждого Data-driven подход к жизни 📈 Работа аналитиком дает понимание, что любая статистика может пригодиться и стать импульсом для благоприятных изменений. Например, я решил отследить, как мое состояние в течение дня зависит от количества часов сна. В течение нескольких недель я вел табличку вида часы сна - состояние днём по шкале 1-10. Удалось выявить закономерность: если я сплю 7 и более часов, состояние значительно лучше чем при меньшем количестве. При этом после 7 часов состояние не особо улучшается с каждым дополнительным часом. Благодаря этим выводам я смог оптимизировать свой график и стать продуктивнее. Умение хеджировать риски и сохранять баланс ☯️ В любом эксперименте есть метрики, которые не являются целевыми, но в любом случае не должны упасть под влиянием нововведений ниже определенного уровня. Так и в жизни, оптимизируя один процесс мы не должны забывать про другие. Например, сейчас я концентрируюсь на работе и учебе, но при этом понимаю, что мне нужно заниматься спортом не меньше 3 раз в неделю. Поэтому я выделил время в конкретные дни и не пропускаю тренировки, четко понимая, что как бы я ни был загружен, 3 раза в неделю потренироваться нужно. Выводы ⭐️ Эти навыки и привычки делают жизнь не только более структурированной, но и более интересной и управляемой. И в целом приятно осознавать что твоя профессиональная деятельность оставляет позитивный отпечаток на всех сферах жизни. Продолжение — в посте Саши. Там он рассказывает о своих неочевидных сценариях использования DS-навыков в жизни. Рекомендую заглянуть, а ещё лучше — подписаться на его канал, там много полезного про работу в DS. А какие преимущества в повседневной жизни вам дает работа с данными? Пишите в комментариях! 💬 Ставьте: 🔥 если было полезно ❤️ если ваши плюсы пересекаются с моими 🤩 если нравится формат коллабораций #жизнь_аналитика #софт_скиллы5,43%
- 24 февр.Путь в аналитику: два взгляда на инвестиции в себя 🐂 Когда люди хотят вкатиться в аналитику, перед ними вырисовывается дилемма: выбрать бесплатные источники (ютуб, stepik, открытые лекции) или готовые курсы, где всё разложено по полочкам — Python, SQL, статистика и иногда даже помощь в поиске первой работы. У каждого пути есть свои преимущества и подводные камни. Поэтому мы с Машей, автором канала RockAnalyst, решили подискутировать на эту тему. Я расскажу, как вошёл в аналитику без вложений, и почему иногда отсутствие денег на старте — это суперсила. А Маша расскажет про свой опыт обучения на платных курсах — со всеми плюсами, минусами и неочевидными последствиями таких инвестиций. Мой путь 🗺 Первый этап: знакомство со сферой 🔍 На 1-м курсе университета был курс по основам Python, но для новичков он шёл тяжело. Летом я сам перепрошёл всё с нуля по курсам «Поколение Python» на Stepik и Ютубу. Это заложило базу и понимание, что аналитика — моё. Второй этап: погружение 🤿 Изучив Python до хорошего уровня, взялся за курс «Основы машинного обучения» Е. Соколова (ФКН ВШЭ). Он полностью бесплатный на вики-странице ФКН. Идеальный уровень для аналитика, не ML-инженера (для таких есть более глубокий курс МО-1). Статистику проходил в универе, а позже для углубления обращался к курсам «Основы статистики». По SQL есть достаточно много открытых материалов, но я выбрал бесплатный курс Карпова и не пожалел. Для нарешивания использую тренажер sql academy. Третий этап: подготовка к работе 🚀 Пет-проекты — must have. Сделал с командой проект по данным с Kaggle (поддержанные авто): EDA, проверка гипотез, линейные модели. Благодаря этому проекту я не только прокачался в EDA и базовом ML, но и обрел проект, о котором можно рассказать на собеседовании. Рекомендации 🔝 Все вышеупомянутые курсы могу смело рекомендовать, они хороши для старта. Если хочется посмотреть что-то на ютубе, есть вот такая подборка, да и в целом там можно найти туториалы по любой теме, особенно на английском. Также уверенно могу сказать, что без практики знания очень быстро стираются, поэтому рекомендую после прохождения курсов регулярно практиковаться. Для Python и SQL есть много хороших тренажеров (SQL academy, Python tutor). В ml можно практиковаться, участвуя в соревнованиях на kaggle. Полезно изучать решения топ-авторов, например cdeotte. Главные преимущества бесплатного обучения ➕ Нет риска: не понравилось - перестал смотреть и нашел другой курс Сообщество: на kaggle есть дискуссии, на Stepik можно найти решения и сравнить со своими вариантами. Что прокачаете вдобавок к хард-скиллам: • Самостоятельный поиск — ключевой навык аналитика. На платных курсах его часто «выключают», давая всё готовое. • Дисциплина — вы сами управляете графиком и мотивацией, а это ценнейший софт-скилл. Мой путь доказывает, что главное в наше время — не деньги, а любознательность, упорство и умение искать. Бесплатные курсы — это полноценная образовательная среда, а не вынужденная замена. А какой у вас опыт? Делитесь в комментариях! 💬 А теперь — вторая сторона медали. Обязательно прочитайте пост Маши о ее опыте обучения на платных курсах. ❗️Важное дополнение Весь этот пост — про вход в профессию. Для старта бесплатных ресурсов действительно достаточно, и мой опыт это подтверждает. Но когда уже работаешь аналитиком, потребности меняются: хочется глубже разобраться в конкретных темах, получить структурированные знания от практиков и разобрать сложные кейсы. В таких ситуациях выбор в пользу открытых курсов уже не так очевиден и платные курсы могут стать подходящим вариантом. Ставьте: 🔥 если было полезно ❤️ если интересны посты про курсы 🤩 если интересны подобные обсуждения с авторами других каналов #старт_в_аналитике #софт_скиллы #образование #карьера4,77%
- 4 мар.Парадокс Симпсона: ловушка, которую обязан знать каждый аналитик ⚡️ Представьте такую ситуацию: вы исследуете данные, в которых есть 2 группы объектов, в каждой из которых прослеживается одна и та же тенденция. Но когда вы объединяете данные, направление зависимости меняется на противоположное. Поначалу может показаться, что в данных ошибка, но на самом деле это один из известных статистических парадоксов — парадокс Симпсона. Парадокс становится возможен, когда каждый объект имеет какой-то существенный признак, и внутри групп распределение по этому признаку неравномерное. Рассмотрим парадокс на примере 🏀 Пусть некий баскетболист в сезоне 24/25 имел такую статистику бросков: Двухочковые: 80 попаданий из 100 бросков => точность = 80% Трехочковые: 10 попаданий из 100 бросков => точность = 10% А в сезоне 25/26 у него такая статистика: Двухочковые: 41 попадание из 50 бросков => точность = 82% Трехочковые: 200 попаданий из 500 бросков => точность = 40% 82% > 80% и 40% > 10%. Хочется сделать вывод, что точность баскетболиста улучшилась. Но посмотрим на суммарный процент попаданий: В сезоне 24/25: 90/200 = 0,45 В сезоне 25/26: 241/550 = 0,438 Как ни странно, точность снизилась. Почему так произошло? 🤔 Все дело в том, что соотношение бросков между двухочковыми и трехочковыми не сохранилось. Пример с интернет-магазином 🛒 В прошлом году интернет-магазин имел: • Десктоп: 1000 посетителей, конверсия 10% (средний чек 50₽) • Мобилка: 1000 посетителей, конверсия 5% (средний чек 200₽) Общая конверсия 7,5%, выручка 15 000₽. В текущем году конверсия упала на каждом типе устройства: • Десктоп: 2000 посетителей, конверсия 9% (чек 50₽) • Мобилка: 500 посетителей, конверсия 4% (чек 200₽) Общая конверсия выросла до 8% (из-за увеличения доли десктопов с высокой конверсией), но выручка упала до 13 000₽ (так как основной трафик теперь идёт через десктоп с низким чеком). Бонус: здесь разобрал A/B-тест на данных отелей. Конверсия растёт по регионам, но падает в сумме — классический парадокс Симпсона. Можно зайти и покрутить данные. Почему этот парадокс важен для аналитиков 📢 • Нельзя доверять только агрегированным данным, нужно анализировать страты. • Особенно критично при оценке эффективности (рекламные кампании, лечение и т.п.). • Про парадокс любят спрашивать на собеседованиях – стоит понимать суть и уметь построить пример. Как не попасть в ловушку 🎣 • Всегда смотреть на данные в разрезе важных признаков (пол, возраст, регион, тип устройства). • Использовать стратификацию перед анализом. • Помнить про скоринг склонностей (PSM – про него тоже когда-нибудь расскажу), если группы несбалансированны. А вы сталкивались с парадоксом Симпсона в своей практике? Делитесь в комментариях! 💬 Ставьте: 🔥 если было полезно ❤️ если интересны разборы популярных вопросов с собеседований 🤩 если интересны посты про статистику #аналитические_методы #статистика #собеседования4,67%
- 17 мар.Мои первые ошибки в аналитике: разбор с последствиями 🫣 Когда я только пришел в аналитику, мои хард скиллы были не на очень высоком уровне, как и софт скиллы, которые я вообще недооценивал. Сегодня я расскажу 3 реальные истории из первых месяцев работы. Это чисто технические ошибки. А поведенческие ошибки разберет Кристина, автор канала risk & data talks Неправильно понял бизнес логику поля 🔍 В одной из первых задач я использовал витрину валютных операций с полем direction, которое принимает значения buy или sell. Я подумал, что buy - значит клиент купил валюту у банка за рубли. Я выгрузил клиентов по критериям и на основе этой выборки мы запустили кампанию продаж. Через пару дней начала приходить обратная связь о том, что данные ошибочные и на самом деле многие клиенты из выборки не совершали сделки покупки валюты у банка. Пообщавшись с коллегами, я выяснил, что оказывается buy - значит банк купил валюту у клиента за рубли. Выборку пришлось пересобрать, а сейлзы потратили время на отработку неверной кампании. С тех пор я всегда проверяю логику атрибутов, где может быть неоднозначная интерпретация. Доверился чужому скрипту без проверки ⚠️ Другой аналитик написал скрипт для поиска определенных клиентов. Я попросил у него скрипт, чтобы переиспользовать для своей задачи. Проверять скрипт я сначала не стал, просто запустил на нужном мне временном периоде и отправил продакт менеджеру excel файл с результатом. Но продакт вернулся ко мне и указал на неоднозначность данных: в файле каждый клиент встречался по несколько раз, чего по условию задачи быть не должно. Оказалось, что аналитик, у которого я взял скрипт, решал немного другую задачу, и код нужно было редактировать перед использованием. Этот случай дал мне понять, что нельзя без проверки использовать чужие скрипты, всегда нужно проверять их и уточнять, какую именно задачу они решают. Не изучил уникальные значения столбца 👀 В одной из витрин с данными по продажам допустили неточность, и часть сделок хранилась с атрибутом product = «Валютные форварда», а часть – «Валютные форварды». Однако я изначально увидел только Валютные форварда, и считал доход только по ним. Спустя время я заметил, что доходы выглядят заниженными. Тогда я наконец выполнил select distinct – и все стало ясно. Теперь я стараюсь всегда смотреть, какие значения может принимать категориальная переменная в витрине, а в часто используемых скриптах еще и делать это регулярно. Выводы 💡 Через эти истории я хотел донести до вас, что важнейшим качеством аналитика является умение мыслить критически и задавать вопросы к себе. Технические ошибки проще заметить, если выработать привычку смотреть на данные под разными углами и проверять себя. Однажды мой руководитель сказал: «Большое число проблем в компании возникает потому, что разные люди берут разные данные и делают на них разные выводы». Но есть и ошибки другого рода – поведенческие. Они не менее часто встречаются у начинающих аналитиков. Именно о таких ошибках рассказывает Кристина в своём канале risk & data talks. Очень рекомендую прочитать её пост и подписаться — там как раз вторая часть нашего совместного разбора. А какие ошибки допускали вы в начале пути? Пишите в комментариях 💬 Ставьте: 🔥 если было полезно ❤️ если допускали похожие ошибки 🤩 если нравится формат коллабораций #жизнь_аналитика #карьера #ошибки4,10%
- 27 февр.Идём учить A/B-тесты ⚡️ Недавно задумался о том, в каком разделе аналитики мне больше всего не хватает знаний, и осознал, что A/B тесты на 1 месте с отрывом. Я знаю теорию и даже решал какие-то задачи, но глобального понимания процесса не хватает. Хочется уверенно определять оптимальный метод для эксперимента, правильно интерпретировать результаты. Я решил, что так это оставлять нельзя и начал ресерч, с целью найти лучшие курсы по A/B и выбрать один из них для себя. ✍️В первую очередь я ориентировался на отзывы аналитиков, прошедших курс, и программу. Мне хотелось найти курс, освоив который я смогу закрыть все пробелы в теории и проработать на практике изученные методы. ✅В итоге мой выбор пал на курс Павла Бухтика. Курс максимально практико-ориентированный: студенты проводят А/B тесты от формулировки цели эксперимента до интерпретации результатов. Курсом довольны как начинающие, так и опытные аналитики. Для первых - это возможность погрузиться в эксперименты с нуля, для вторых - отличный способ расширить свой кругозор и изучить продвинутые методы. 🚀Павел имеет 7+ лет опыта работы и обладает широчайшей экспертизой в экспериментах. Он сам ведет занятия, проверяет домашки и дает обратную связь. ⏰Осталось 2 дня, чтобы оставить заявку. Следующий поток будет только осенью, поэтому рекомендую не откладывать! Я хочу прокачаться в A/B, поэтому залетаю на курс. Если тоже хотите - погнали вместе, заявку можно оставить тут Сегодня уже первая встреча потока, а в понедельник – первое занятие. Осталось всего 5 мест ❗️ Важно: мое решение пойти на курс не противоречит предыдущему посту. Я чувствую, что сейчас мне нужно укрепить свои знания в A/B и считаю, что данный курс - оптимальный вариант для достижения этой цели. #образование #карьера4,05%
- 4 маяКорреляционный анализ 🔗 Недавно был пост про отличия корреляции и причинно-следственной связи. Сегодня же расскажу подробнее про корреляционный анализ, рассмотрим его со всех сторон. Некоторые методы я сам узнал не так давно, поэтому думаю будет полезно не только новичкам. Зачем нужен корреляционный анализ? 🤔 Корреляции помогают оценить силу связи между переменными. Это полезно на этапе исследования данных, как перед моделированием, так и например для выявления инсайтов. Например, анализ корреляций помогает выявить мультиколлинеарность. Также корреляционный анализ используется для поиска прокси переменных в А/Б тестах. Прокси переменные - переменные, сонаправленные с ключевой метрикой эксперимента. Используются, чтобы быстрее замечать влияние на ключевую метрику. При этом важно не забывать про статистическую значимость этой связи и интерпретировать корреляции в связке с ней. Я собрал для вас подробный гайд, где на датасете применяю все методы, описанные в этом посте, сохраняйте и пользуйтесь Как провести корреляционный анализ? Первый шаг - визуализации 📈 Классическим вариантом визуализации является heatmap. Как правило его строят для непрерывных переменных, но можно сделать и кастомный вариант. Также для непрерывных переменных можно построить scatterplot с линией тренда. Визуализации помогают увидеть выбросы и нелинейности, в случае которых обычная корреляция Пирсона может не подойти. Измерение корреляций ➕ Здесь важно отталкиваться от типа данных, связи которых мы измеряем. Непрерывный + непрерывный: Для таких данных в большинстве случаев подходит обычная корреляция Пирсона (которую как правило и называют корреляцией). Она измеряет силу линейной связи. Если вы заранее понимаете что зависимость нелинейная, лучше использовать методы, описанные далее. Если есть выбросы и/или зависимость нелинейная, например как описано здесь, подходят корреляции Спирмена и Кендалла, при этом Кендалл лучше приспособлен к малым выборкам. Непрерывный + бинарный: Для таких случаев принято использовать точечно-бисериальную корреляцию. Это один из подвидов корреляции Пирсона. Непрерывный + категориальный (>2 категорий): Для такой связки используют корреляционное отношение эта. По сути оно измеряет долю дисперсии непрерывной переменной, объяснённую категориальным признаком. Измеряется тоже от 0 до 1, где чем больше - тем сильнее связь. Категориальный + категориальный: Для таких случаев подходит коэффициент V Крамера. Измеряется от 0 до 1. Остальные связки типов переменных решил не расписывать здесь, инфо по ним можно посмотреть в гайде. Как интерпретировать корреляции? 😮 Во-первых, всегда нужно измерять статистическую значимость корреляции. В гайде есть функции расчета p-value для каждого метода. Только если корреляция оказалась статзначимой, можем приступать к непосредственной интерпретации (по модулю): 0 - 0.3 слабая связь 0.3 - 0.7 умеренная связь 0.7 - 1 сильная Подводные камни ❗️ Во-первых, корреляция не всегда означает причинно-следственную связь. Во-вторых, даже если связь есть, нельзя интерпретировать её как единственный драйвер. Например, температура воздуха в Сочи влияет на количество туристов. Но на это количество влияет еще и множество других факторов (экономическое положение, цены на аренду жилья, количество других курортов и т.д) А вы используете корреляционный анализ? Знали про все виды корреляций из этой подборки? Пишите в комментариях 💬 Ставьте 🔥 если нравится такой формат: пост с разбором + ноутбук с кодом #аналитические_методы #гайд3,51%
- 12 мар.Самая скучная, но самая важная привычка в моей работе 🥱 Думаю, каждый из нас хоть раз ошибался и отправлял коллеге неверные данные. У меня это последний раз случилось на прошлой неделе, поэтому я решил составить себе чек-лист для проверки данных перед отправкой, чтобы в следующий раз не попасть впросак. Этим чек-листом поделюсь и с вами, уверен, многим будет полезно. Уникальность и дубли 🛍 Нет ли задвоений там, где их быть не должно (id клиента, номер транзакции и т.п.) В pandas это легко проверить сравнением shape датафрейма и .nunique() по столбцу. Также у меня в практике были случаи, когда задвоение оказывалось не ошибкой, а бизнес логикой хранения данных. Если при выгрузке из новой для себя таблицы вы видите неочевидные для себя моменты, лучше обратиться к менеджеру данных, чтобы понять по какой логике происходит заполнение витрины. Контрольные суммы 👆 В данных по платежам, транзакциям часто можно напороться на двойной учет, например, 1 строка – для самой операции, вторая – для перевода между разными статьями баланса банка. В таком случае нас не интересует вторая строка. Сейчас я когда встречаюсь с новым источником данных по действиям пользователей (переводы, оплаты и т.п.) беру несколько случайных id и смотрю, сколько строк по каждому из них выгружается. Если неожиданно выгружается >1 строки, надо копать глубже. Также при подсчете сумм, средних и других агрегатов можно смотреть динамику к прошлым периодам для сравнения и проверки подсчетов на адекватность. Даты 📆 В витринах часто бывает так, что определенным объектам присваивают даты из будущего (например, договор заключен, но сделка состоится только через 2 месяца). Важно знать о возможности возникновения таких случаев и быть аккуратным с фильтрами на дату типа > <. Тут опять же помогает понимание устройства витрины. Также иногда пропуски дат заполняют одной определенной датой, это можно вычислить по большому количеству строк с этой датой. Выбросы, аномалии и ошибки в данных 👻 Для детекции таких случаев можно смотреть max, min и mean по выборке. Если одно / несколько значений сильно выбивается из общей картины, стоит выяснить, выброс это или же ошибка в данных. Я однажды встретился с витриной, где значение в поле “номинал” заполнялось менеджерами по продажам со слов клиента руками. При этом не было единых правил и кто-то вносил номинал в млн рублей, кто-то в рублях. Для перевода в единую шкалу (рубли) я использовал if else алгоритм, где например номиналы = 1 интерпретировал как 1 млн. Типы данных 🗂 Тут объясню на примере. В первые дни работы я еще не знал, что при чтении excel файлов в pandas значения ИНН интерпретируются как числовые, если не задать строковой тип для столбца при чтении файла. Из-за этого я терял некоторых клиентов, так как у них первым знаком ИНН был 0, который терялся при чтении. Важно всегда проверять типы данных и проверять итоговые файлы на адекватность, иначе риск ошибки очень велик. Выводы ❗️ Я постарался перечислить основные места, в которых можно накосячить. Главные советы – проверяйте итоговые файлы на адекватность и будьте уверены, что понимаете устройство витрин. Не стесняйтесь задавать вопросы коллегам и менеджерам данных. Сохраните этот пост в закладки, чтобы перед важной отправкой пробежаться по списку 📌 А какие методы используете вы для проверки данных? Пишите в комментариях! 💬 Ставьте: 🔥 если было полезно ❤️ если интересны подобные чек-листы с ошибками 🤩 если просто рады приходу весны #данные #чеклист3,47%