Это разве аналитика?
СтатистикаПривет, я Андрей @ab0xa, bi / de / java dev Анализ данных и визуализация, интересные ссылки, вакансии, уроки, юмор) и личный опыт Стек технологий Python, Java, SQL, Tableau, Knime, Yandex.Облако, Yandex DataLens
- Последний пост
- 13 авг.
- Последнее чтение
- 11:57
- Постов за неделю
- 3
- Всего постов
- 69
- Тип
- открытый
- Язык
- русский
- Категория
- Карьера
- В каталоге с
- 12 авг.
- 1/24сутки в ленте
- 239
- 1/48двое суток
- 273
- 1/72трое суток
- 295
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Хочу проверить, как вы думаете. Держите дело 🕯 Из пятницы в пятницу вы читали, как я собираю это по кускам. Пора показать целиком. DATA NOIR 🔥 Ночь, лампа, стол, папка с делом. Вы осматриваете место преступления, ищете подозреваемых по приметам, допрашиваете, ловите на лжи, тянете нити между уликами на доске. С миром дела вы говорите SQL-запросами. Но учить SQL вас никто не заставляет. Запрос это просто ключ под конкретную дверь. сначала решаете, какую дверь открыть, и уже под неё ищете ключ Правильной кнопки тут нет 🔎 Это приключение, где каждое решение вы принимаете лично. Никто не подсветит нужную улику. Подозреваемые врут. Самый очевидный подозреваемый чаще всего и есть ловушка. В деле про украденную пластинку первым под руку лезет богатый коллекционер. Мотив на поверхности, деньги есть, репутация так себе. Проверьте его. Посмотрите, что будет )) Явно верного пути нет. Есть ваша версия и факты, которые её либо держат, либо рассыпают. Ошиблись с обвинением, минус $10 с жетона и обратно к фактам. Что за этим стоит 🛠 Полтора года заметок, потом сборка. Свет от лампы, доска с нитями, схема таблиц, переписанный онбординг, про каждое из этого я тут уже писал, по второму кругу не пойду. Просто держите в голове, что стоит за этой картинкой. Как зайти 🤔 https://data-noir.com/ Важно: сейчас портал открывается только через VPN. Включайте. Начните с дела №0, это пробный обход. Там вас проведут за руку. Дальше уже сами. Просьба, и она серьёзная 🙏 Проект живёт, пока в него играют. Тот же онбординг я переделал только потому, что один человек сел за стол и честно сказал, где ему плохо. Сам я эти места уже не вижу, привык. Так идея одного человека и превращается в коллективное решение. Но для этого нужны игроки. Поделитесь проектом со всеми, с кем можно. Рабочий чат, личка, коллега, который любит задачки для мозга. Сейчас это та помощь, которая нужна больше всего. А что не зашло, напишите в комментариях 👇 @data_dzen 🙂
😂😂😂😂😂
Цифры от которых бывает печально смотрю на отчеты топ облачных компаний. За 2 квартал. Azure - $100+ млрд/год. Рост +43% год-к-году. AWS - $168 млрд/год ($42 млрд/квартал). Рост +27% год-к-году. Для сравнения - топ облако в России - Яндекс Клауд показал $0.3 млрд в год. Примерно столько же, сколько Clickhouse Inc. Российский рынок ИТ по оценке ТАдвайзера - 3,5 трлн рублей в год. Равно $45 млрд. Капексы только двух компаний Azure + AWS за год - это больше чем потратили на российский ИТ за всю его историю. Привет моему любимому типу заказчика российского облака: "Ну в Амазоне конечно же круче сделано, чем у вас!" Да чудо что мы смогли к AWS вообще хоть как-то приблизиться имея примерно 0,2% его ресурсов.
без подписи
без подписи
без подписи
без подписи
⚡️ Классика конфы SmartData: пайплайны, Kafka и качество данных Пока все обсуждают LLM и агентов, кто-то должен собирать пайплайны, чинить брокеры и отвечать за то, чтобы данным можно было верить. Мои друзья из JUG Ru Group осенью традиционно проводят конференцию SmartData. В этом сезоне она обновилась: в программе стало больше ML, LLMOps и ИИ. Но классический Data Engineering — то, за что многие ценят конференцию, — остается ее основой. В карточках организаторы собрали для вас новые доклады про dbt, Kafka, структуры данных, Data Governance и Data Quality. 🗓23-24 сентября, Москва+онлайн 🔥Купить персональный билет со скидкой 15% по промокоду etoanalytica можно — на сайте конференции.
Обычно аналитик приходит в готовый стек. А если стека нет? В курсах и руководствах обычно предполагается, что дашборды уже есть, данные уже прилетают в хранилище, метрики уже согласованы. В реальности старший аналитик чаще получает противоположное: систему с историей, где логика размазана по коду, аналитического слоя нет вовсе, а продакт хочет цифру ко вторнику. karpovꓸcourses собрали бесплатный интенсив «Как аналитику разобраться в сложном домене и влиять на бизнес-решения» — как раз про такую отправную точку. Разбор на кейсе Авиасейлс: технология комбинирования билетов, метрика на 10% ниже OKR (цели и ключевые результаты), понимания про причину — нет. Разберем весь путь: как заходить в чужой домен, добывать данные, строить инструменты и в итоге двигать бизнес-показатель. На интенсиве: - метод входа в незнакомую систему; - декомпозиция сложной метрики; - перевод сырых данных в бизнес-инсайты; - инструменты, которые снимают поток ad hoc-запросов; — как связать аналитику с OKR. Ведет Илья Шведов, старший аналитик Авиасейлс. За регистрацию сразу приходит пак: путь аналитика от младшего специалиста к старшему, подборка по А/Б-тестам, материалы по статистике от Анатолия Карпова, «Нейросети для аналитика данных» и карта компетенций в DS (науке о данных). Регистрируйтесь по ссылке — https://clc.to/erid_2W5zFH6RrTj Реклама. ООО «КАРПОВ КУРСЫ». ИНН 7811764627. erid: 2W5zFH6RrTj
Lakehouse для аналитиков и инженеров данных Приглашаем изучить популярный подход построения хранилищ данных Data Lakehouse c разделенным Compute и Storage на основе Iceberg и Trino. В программе курса: • Современная архитектура аналитических систем от DWH и Data Lake до Lakehouse с разделением Compute и Storage на базе Apache Iceberg и Trino. • Iceberg: управление файлами, снимками, каталогами, схемами изменений и очисткой. • Практическое использование Iceberg Catalog, работа с кластером Trino (на Kubernetes), подключение данных на S3 и выполнение SQL/ Python-запросов. • Работа с Iceberg+Trinо на больших масштабах: сложные запросы к датасету TPC-DS (2.8 млрд строк), интеграция с DBT, Apache Airflow, оценка производительность систем. • Построение пайплайнов, инструменты для корректной поддержки, обновления и масштабирования Lakehouse-инфраструктуры на уровне предприятия. Кто мы: R&D-центр Devhands, наш канал. Автор курса — Алексей Белозерский, CDO в inSales (Сбер 2B), ex: VK Tech, М.Видео, Эльдорадо 🗓 Старт курса: 27 августа Изучить программу и записаться можно здесь. Ждём вас! Реклама. ИП Рыбак А.А. ИНН 771407709607 Erid: 2VtzquZf5с8
Пять базированных вещей для тех, кто вкатывается в аналитику Часть 2 Первая часть здесь, и там мы остановились на: А что менеджеру-то отвечать, если он спросит про падение метрик? 4️⃣Умение объяснить результат Возможно теперь это умение конкурировать с AI за экспертизу. Но еще это умение не городить сложные модели, которые никому не нужны. Давайте не будем строить космолеты с катбустом из 50 фич, когда достаточно просто таблички со скорами. А давайте теперь представим, что бизнес просто сходил в ChatGPT и спросил что ему нужно напрямую. Ему отвечают быстро, красиво, правильно и уверенно. Почему бизнесу должно ждать именно нас? А вот почему: потому что мы знаем контекст, данные, ограничения и подводные камни конкретно этого бизнеса и конкретно этих гипотез. Мы можем задать правильный вопрос до того, как начать строить модель. А ллмки пока работают с тем, что им дали. Наша же задача работать с тем, что происходит в реальности и возможно это не перенесешь в контекст модельки. Умение слушать бизнес и переводить его вопросы в задачи AI не заменит еще достаточно долго 5️⃣Воспроизводимость Мы обучили модель, получили 0.95 ROC-AUC. Через неделю пересчитали и стало 0.85. А в чем проблема? Ллмка говорит, что random_seed не был зафиксирован, а еще версия нампая обновилась. А теперь добавим реальный рандом в пайплайн - промпты, апишки, генерацию рандома и фичей через модель. становится ли воспроизводимость сложнее? А что если модельку убрали на бэкенде провайдера, а потом через несколько недель вернули. А наш пайплайн уже все - дает другой результат. Мне кажется, что те люди, которые умеют строить воспроизводимые пайплайны с эйяем внутри будут иметь спрос сильно больше, чем на вес золота Скажу базу - AI мощный инструмент в руках того, кто понимает суть и глубину вопроса С другой стороны уже нет столько времени изучать большие материалы в сильно динамичном мире. Забудьте про roadmap'ы с миллиардами курсов. Берите проблемы и вопросы, которые вас реально беспокоят и на них практикуйте SQL, статистику, питоны. Сделайте из этого реальный проект, пиште код, который будет работает одинаково. Ну и собирайте команду единомышленников, чтобы взаимодействовать друг с другом. Согласны? Надеюсь никого не напугал? Кстати, можем попробовать собрать мини-комьюнити с таким движняком - с вас эмодзи или стикеры в комментариях. А с меня время на подумать #ml #career #novice #softskills #llm #agents
Пять базированных вещей для тех, кто вкатывается в аналитику Часть 1 Недавно разбирал резюме кандидатов на вакансию и в который раз заметил одни и те же шаблоны. Открываешь резюме, и там написаны все ключевые слова, супер проекты, несколько лет опыта в виде прохождения курсов, ну и скорее всего перед собесами выучены одни и те же источники с ответами на 100 самых известных вопросов. А потом откликаются на непростые вакансии с узкой направленностью и на первых же вопросах идет столкновение с бурмалдой реальностью. Я решил поделиться с вами пятью вадными пунктами, без которых просто не выжить в этих датасаенсах, когда начнешь работать. Кстати, в последнее время наблюдается новый уровень этого явления, когда вообще нет желания что-то ботать, ведь AI сделает все лучше: Зачем мне SQL/статистика/питончик - у меня есть ChatGPT, он все напишет 1️⃣SQL Я уже писал об этом, и реально рекомендую начинать именно с SQL. Больше половины рабочего времени уходит на подготовку, обработку данных и приведение их в нормальный вид. SELECT, WHERE, JOIN, GROUP BY, оконные функции - это обычный базовый минимум. И пусть ChatGPT напишет вам запрос и возможно он заработает с первого раза. Только как вы поймете, что он написал его правильно, если сами не знаете SQL? Я по долгу своей работы неоднократно видел кейсы, когда скармливаешь LLM весь контекст задачи, раздаешь тулы, доступы, апишки, и возможно даже на выходе получаю красивый запрос. Но блин есть вероятность, что он либо не отработает, либо выдаст не тот результат. Допустим из-за неправильного джойна или не выбора не той колонки из 5-ти похожих. Ну и прикиньте, если кто-то из нас спокойно понес бы этот результат бизнесу, потому что проверить не хватило экспертизы 2️⃣Статистика Описательная статистика, выборки, доверительные интервалы является еще одной из баз аналитика. Скорее всего на реальном проекте придется спорить с бизнесом о том, значима ли разница в метриках, и стоить ли катить серый тест. Я уверен, что аргументов у вас будет больше с развитым знанием статистики. Проблема сейчас кстати есть и с другой стороны - теперь бизнес приходит с распечаткой из Клода и говорит: "Смотри бро, модель говорит, что разница значима, катим тест". Ну и в таких случаях точно нужно уметь объяснить, почему ллмка здесь могла ошибиться из-за отсутствия правильного контекста, и конечно предложить нормальный статистический тест. Пока AI не сможет собирать весь контекст, он не заменит языка выводов в том смысле, в котором знаем его мы 3️⃣Реальный проект Напомню, что в последнее время требования растут. При входе в профессию уже не хватит просто знаний Python и SQL. Нужен реальный и работающий проект, сделанный полноценно от формулировки задачи до крутых метрик и выводов. И скорее всего уже не Kaggle (только если не планируется там лутать медали). Реальный имеется в виду такой, где мы сами собирали данные, чистили пропуски, работали с дубликатами, обучали модель и тестировали гипотезы. Хорошая новость - AI реально может ускорить рутину и написать весь этот код с чисткой данных, бейздайнами и пайплайнами, уже и предложит идеи по фичам. Плохая новость - если ты бездумно использовать ллмки как костыль с первого дня, ты возможно мы не на 100% погрузимся вглубь того, что сейчас происходит внутри проекта. Как можно управлять процессом, которого не понимаешь? Что делать, если все поломалось и данных нет? Какой вариант правильный из трех предложенных агентом? А что менеджеру-то отвечать, если он спросит про падение метрик? Продолжение завтра... А пока накидайте ваших мыслей в комментарии, что же там может быть еще? #ml #career #novice #softskills #llm #agents
Какой-то микс нынче в дата мире происходит Сократят ли кожаных в пользу AI? Я тут погуглил. Мне кажется, что эти 2 компании умеют пользоваться иишкой как никто другой. Ну и чего, сократили там кого-нибудь? :) С другой стороны не пользоваться сейчас таким инструментом кажется довольно глупой идеей. Не знаю как у вас, у нас в командах данных текучки более 50 процентов. Я больше 10 лет пишу код, около 5 лет в текущей компании. Писать очередной оператор в эйрфлоу, объяснять зафиксированные метрики в дбт в очередной раз? Увольте пусть ии ответит за меня. И вот эта история с данными, мне кажется, подводит отделы данных к решению такой задачки, как создание "единого хранилища контекста", а моем понимании ai платформы в компании. Что все понимают под этими словами (и понимают ли) - большой вопрос. Есть ли какие-то устоявшиеся шаблоны или хотя бы примеры - нет. Можно ли угадать, куда пойдет развитие иишки - нет. Именно поэтому это довольно клевая задача :) Похоже, что StarRocks будет все меньше (хотя мы его и опробовали как хранилище векторов, и у меня для него лежит написание нативного CDC на гошке в беклоге), а больше будет всего подряд про современную техничку в офисе данных во всех ее ипостасях. Потому что никто не рассказаывает про графы для dbt, платформы агентов, тлен векторизации и как подсадить хотя бы 100 человек на свои скилы (оказалось, что писать mcp на гошке - кайф) :) PS кстати dbx - тормозная штука с глюками интерфейса. И да, это тот момент, когда даже гуй на жабе быстрее.
без подписи
без подписи
MotherDuck сделали классный сервис для своего демо, который анализирует данные с LLM
📊 Глубокое погружение в профессиональные инструменты на реальных проектах. Записывайтесь на курс «Системный аналитик. Экспертный уровень». 🎁 Учавствуйте в 3 бесплатных вебинарах — познакомьтесь с программой обучения и преподавателями. Задайте свои вопросы экспертам! 6 августа, 20:00 мск — «Пользовательские сценарии (Use Cases) на реальном примере»: от бизнес-требования до задачи разработчику. Анализ требований, создание Use Cases, связь с разработкой, Q&A. 13 августа, 20:00 мск — «Управление данными в MSA»: цена ошибок дублирования данных, оптимизация инфраструктуры и выбор БД (SQL vs NoSQL), единый глоссарий и контракты данных без бюрократии, требования к качеству данных для ИИ, чтобы модели не «галлюцинировали». 20 августа, 20:00 мск — «Аналитическая дженга»: как проектировать и управлять изменениями системы через BACCM, (4+1) и C4, чтобы архитектура не рассыпалась. Записывайтесь https://clck.ru/3UzbGN Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576, www.otus.ru, erid 2VtzqxhzotN
Где-то рядом с культом железки у нас живет культ героя. Давайте представим 2 команды. Команда А. 1-2 года делала качественный продукт. Он просто выкатывается в любого заказчика, без проблем интегрируется со всем что надо и дальше работает без косяков. Команда Хэ. Сделала нечто, оно развалилось у заказчика в первый же день. И следующую неделю все Хэ не спали, не ели, а правили баги и решали все на свете проблемы на этапе деливери. Какая из команд будет на хорошем счету у директоров? Кого похвалят на корпоративе? Кому дадут ресурсов на следующем этапе? Прости, товарищ Генри Форд, но эффективность у нас не в почете, у нас в почете героизм вопреки всему. Особенно вопреки собственному многолетнему раздолбайству.
без подписи
Ребят, тут Авито регистрацию на свой первый CTF открыл с призами до 300 000 рублей на команду 📍 AvitoTech устраивает CTF онлайн с денежным призовым фондом, мерчем и интересными тасками! Регистрация команд уже открыта по ссылке, а ниже собрали инфу, что предстоит делать во время HoneyBadger CTF AvitoTech. Возьмите на себя роль медоеда, проверьте защиту пчелиного улья и найдите все скрытые уязвимости в сотах. Чего ждать от турнира: тасков на веб-уязвимости, инфраструктурных мисконфигов, анализа скомпилированного кода, расследования инцидентов, слабостей шифров, всего, что требует хакерской смекалки. И розыгрыша мерча, помимо основного призового фонда. Важно: CTF не только для спецов по кибербезопасности — есть отдельная лига для всех, кто любит разбираться, как устроены IT-системы 🐝