Khan of data & analytics🎲
СтатистикаКанал об аналитике, data science, алгоритмах и математике. Здесь я делюсь интересными задачами для подготовки к собеседованиям (и просто чтобы пошевелить мозгами), рассказываю о крутых книгах, олимпиадах и многом другом. по вопросам @khan17ds
- Последний пост
- 14 авг.
- Последнее чтение
- 13 авг.
- Постов за неделю
- 2
- Всего постов
- 23
- Тип
- открытый
- Язык
- русский
- В каталоге с
- 13 авг.
- 1/24сутки в ленте
- 1 702
- 1/48двое суток
- 1 950
- 1/72трое суток
- 2 103
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
Салем всем! тут друзья ищут ML Engineer: 📍 Алматы | Офлайн Мы разрабатываем AI-платформу для сферы управления отходами и городской инфраструктуры. Ищем ML Engineer, который будет создавать и внедрять модели машинного обучения для анализа фото, GPS-данных, телеметрии транспорта и других источников данных. Чем предстоит заниматься: Разрабатывать, обучать и внедрять ML-модели для различных бизнес-задач. Работать с фото, GPS-треками, телематикой, сенсорными и табличными данными. Разрабатывать модели для распознавания объектов, классификации, прогнозирования, поиска аномалий и оптимизации процессов. Подготавливать данные для обучения моделей (сбор, очистка, feature engineering). Оценивать качество моделей и улучшать их точность. Интегрировать ML-модели в backend-сервисы и production-системы. Участвовать в развитии AI-направления компании. Что мы ожидаем: Коммерческий опыт работы ML Engineer от 2 лет. Уверенное знание Python. Опыт работы с PyTorch, TensorFlow или Scikit-learn. Понимание классических алгоритмов Machine Learning и современных подходов Deep Learning. Опыт работы с данными: подготовка, анализ, обучение и оценка моделей. Знание SQL. Опыт работы с Git, Linux и Docker. Будет плюсом знание Go. Будет преимуществом: Опыт работы с Computer Vision. Опыт анализа GPS-треков, телеметрии или IoT-данных. Опыт работы с временными рядами и прогнозированием. Опыт работы с LLM, мультимодальными моделями или RAG. Опыт работы с Kubernetes и облачной инфраструктурой. Знание MLOps (MLflow, DVC, Weights & Biases и др.). Что важно увидеть в резюме: Коммерческий опыт разработки ML-решений. Реализованные проекты с описанием задач и результатов. Опыт вывода моделей в production. GitHub, Kaggle или портфолио (если есть). Мы предлагаем: Работу над реальными AI-продуктами с большим объемом данных. Возможность создавать решения, которые используются ежедневно. Сильную инженерную команду. Профессиональный рост и возможность развивать новые направления AI. Конкурентную заработную плату. 📩 Отправляйте резюме в Telegram: @kuandykzx
видео или голосовое, без подписи
Короче, я как дед - на выходных решил вспомнить молодость) и поучаствовать в соревнованиях по ML. Причины простые: 1️⃣ Вспомнить что такое кодинг вообще) я кпц как давно не кодил, а мне ещё возможно скоро преподавать надо) 2️⃣ За эти годы накопилось дофига моделей , хотелось их просто протестировать 3️⃣ Ну и чисто утешить себя, что я всё ещё сильный MLщик) или просто кайфануть от процесса, как раньше По первому пункту вообще не то вышло — в этом вайбкод-мире) Весь код за меня писал Claude — думал отключить её, но мозг не выдержал)) Я чисто ревьюил, накидывал таски промптами, проверял, где-то задавал бизнес-логику для фичей. Дофамин капал только в момент сабмита, когда пробивал норм скор) По второму пункту Взял две площадки: старую соревну на Zindi (https://zindi.africa) — чисто поиграться, и одну актуальную на Kaggle. Тестировал три модели: 🔹 Моя самая любимая LightAutoML — благодаря ей в своё время реально дизелил в мире ML)) 🔹 Крутая либа TabM — DL для табличных данных: https://github.com/yandex-research/tabm 🔹 Увидел у друга пост про новую модель TabFM — от Google, с интересной архитектурой, типа ChatGPT для табличных данных. Нюансов там много, можно почитать у Мадияра: https://t.me/mkhamzanovv/43 Раунд 1 — Zindi (данных мало) Модель Public Private TabM 0.877473 0.853887 LAMA 0.870445 0.862883 TabFM 0.889464 0.880525 Blending 0.880305 0.881432 Тут по приватному скору лучше всех — TabFM: на малых данных она реально жжёт) Заблендил все три — скор чуть подрос. Раунд 2 — Kaggle (данных вагон) Модель Score LightAutoML (LAMA) 0.87672 TabM 0.94833 А вот тут TabFM вообще не вывезла — ей нужны серьёзные ресурсы и мощный GPU, так что почти сразу отвалилась. Зато TabM показала очень крутой результат прямо сходу) Кстати важный нюанс: LAMA — это AutoML, но фичи сам не генерит, зато всё остальное (подбор моделей, тюнинг, валидацию) делает отлично. Раньше как раз на этом и играл — чисто за счёт понимания продукта руками генерил уникальные фичи и делал модель лучше, чем у сеньор-MLщиков на проекте) А TabM — это уже нейронка, которая может сама внутри генерить фичи, поэтому тут и скор такой высокий, видимо, во многом за счёт этого. Если будет время — хочу ещё посидеть с LAMA и TabM на Kaggle, покрутить их получше. в итоге по третьему пункту — с вайбкодингом точно не стал хуже)
скинули прикольный сайт — "Дашборд как продукт" https://working-in-it.github.io/dashboard-as-a-product/ Это не просто статья, а целая интерактивная карта продуктового подхода к дашбордам: 18 артефактов (разложены по 4 слоям) и 17 процессов (6 фаз), с примерами под конкретные BI-системы. Пробежался по карте — сделано реально аккуратно, удобно кликать и разбираться, и видно, что авторы сами не первый год варятся в этой кухне, а не просто накидали красивых слайдов. А в внизу сайта мысль, которая, кажется, многим не хватает: Дашборд без продуктового подхода — это график, который кто-то когда-то сделал. Дашборд с продуктовым подходом — это инструмент, который помогает принимать решения каждый день.
🚀 Intern Product Analyst в ChillBase (оплачиваемая стажировка с офером) ChillBase — игровая компания с офисами в Алматы, Ереване и Тбилиси. Берут стажёра в продуктовую аналитику: реальная дата, реальные метрики, работа наравне с синьорами с первого дня. Не курсовая практика, а full-time погружение в команду. Задачи: • С первого дня влетать в процессы, копаться в реальной дате и крутить метрики продуктов вместе с командой. Требования: • Студент старших курсов, выпускник технического / математического вуза или успешно окончил профильные курсы по аналитике данных / продукта; • Сильная база, развитое логическое мышление и любовь к цифрам; • Базово знаешь SQL и Python (или готов доказать, что быстро их освоишь); • Не боишься неопределённости и любишь докапываться до сути цифр; • Готов принять челлендж, работать наравне с синьорами и строить международную карьеру. Трек роста: • 3 месяца оплачиваемой стажировки → если хорошо проявляешь себя, приглашение в штат на испытательный срок → полноценный оффер и помощь с релокацией в Алматы, Ереван или Тбилиси. Условия: • Локация: полная удалёнка на старте или гибрид (если уже находишься в Алматы или Ереване); • Full-time, 40 часов в неделю; • Длительность: 3 месяца; • Оплачивают время и мозги с первого дня; • Перспектива офера в штат с релокацией. 📎 Как откликнуться? • Вакансия: [Ссылка] • Рекрутер: @Kseniya_Mezurnova #product_analyst #intern #международка #FunTech #Gaming
По сути джун делает Q1, мидл — Q2, сеньор — Q4, обычная карьерная лестница. И кажется, если заменить джунов на агентов — ничего не изменится. Но не всё так просто ) Но аналогия ломается не потому, что агенты «умнее». А потому, что джун — это инвестиция, которая со временем сама становится проверяющим и наставником. Агент — нет: он удешевляет исполнение, но не создаёт ни доверия, ни новых экспертов. Те самые три сбоя сверху. Отсюда личный вывод. Ставку имеет смысл делать не на скорость исполнения (она обесценивается), а на три вещи: умение верифицировать, готовность отвечать за результат и работу в зонах, которые пока не оцифровать. Грубо говоря — переезжаем из Q1 в Q3–Q4. И тем, кто сейчас джун, об этом стоит думать заранее))
Получаем 4 квадранта. Примеры из своей области 🟩 Q1 (нижний левый) — дёшево автоматизировать, дёшево проверять. Здесь лежат задачи, где метрики успеха кристально ясны, а обратная связь мгновенна. Агент пишет — ты ревьюишь за секунды. Аналитик: SQL по чёткому ТЗ, сборка типовых дашбордов (когда структура уже ясна), расчёт статзначимости A/B по стандартному шаблону, базовая очистка данных, базовый ETL. ML-инженер: бойлерплейт-код для инференса, сборка Docker-образов, генерация юнит-тестов для понятных функций, базовый feature engineering (например, нормализация) и т.д. По прикидкам авторов тут лежит ~59% всей работы — и этот квадрант агенты съедают первым. 🟥 Q2 (верхний левый) — дёшево автоматизировать, дорого проверять. Самый коварный. Это «слепая зона». Сгенерировать решение легко, но чтобы понять, не принесёт ли оно катастрофу, нужно ждать месяцы (длинный t_fb) и тратить часы дорогого сеньора (S_nm). Так и возникает экстерналия «Троянского коня» — иллюзия продуктивности, под которой копится скрытый долг. Аналитик: оценка incrementality от больших рекламных кампаний, прогноз LTV на годы вперёд, дизайн сложных causal-моделей. Агент выдаст красивый и статистически убедительный отчёт сегодня — но если он заложил кривой прокси-показатель, бизнес потеряет миллионы, а узнает об этом только через квартал. ML-инженер: проектирование reward-модели для RLHF, автоматическое «исправление» дрейфа данных в проде, RAG над сложной корпоративной базой знаний. Агент может «починить» дрейф, просто откинув важный когортный признак: метрика вырастет, а модель начнёт дискриминировать часть пользователей. Суть: ИИ безжалостно оптимизирует метрику в ущерб реальному смыслу (Goodhart's Collapse), а у тебя нет ресурсов перепроверять каждый шаг. 🟦 Q3 (нижний правый) — дорого автоматизировать, дёшево проверять. Агенту тяжело, потому что задача требует физического, социального или исторического контекста, которого нет в обучающих данных, или метрики размыты. Но как только человек находит ответ — проверить его элементарно. Аналитик: «детективное» расследование внезапного падения метрик. Агент видит только цифры, а человек идёт к сейлзам, узнаёт, что партнёр сменил API, и сводит это в один слайд для C-level. Найти причину сложно (нужен социальный контекст), но CEO проверяет результат за секунду — «да, звучит логично». ML-инженер: root-cause анализ странной регрессии модели в проде. ИИ трудно копать вне кода (например, догадаться, что поставщик данных обновил схему таблиц). Но когда инженер находит сломанный пайплайн, фикс занимает одну строчку, а зелёная метрика сразу подтверждает успех. Суть: зона временно живая, но граница измеримости постоянно сдвигается. Как только контекст оцифруют (логи зумов, расширенная телеметрия) — задача улетит в Q1. 🟪 Q4 (верхний правый) — дорого автоматизировать, дорого проверять. Зона «найтовской неопределённости»: исторических данных нет, а значит, агент не может вывести вероятности. Здесь продаётся не исполнение, а готовность нести ответственность (liability) за решения. Аналитик: определение North Star Metric продукта. Перевод абстрактной тревоги CEO («нас жмут конкуренты») в архитектуру системы измерений. Выбор того, какими guardrail-метриками мы готовы пожертвовать ради роста. Правильного ответа в документации нет — это арбитраж бизнес-интенций. ML-инженер: стратегическое решение о выкатке: стоит ли +2% точности того, чтобы добавить 100 мс latency и словить репутационные риски от редких галлюцинаций? Плюс дизайн самого фреймворка верификации — как мы вообще будем проверять будущих ИИ-агентов? Суть: здесь люди работают как «директора намерений» и страховщики рисков. Вывод по картинке: дорожает не «ум», а умение проверять и брать на себя ответственность. Сама генерация едет к стоимости компьюта.
Наткнулся на интересную статью «Some Simple Economics of AGI» — это глубокое экономическое исследование того, как ИИ меняет саму суть работы, ценности и экономики. Главная мысль: когда ИИ сделает выполнение задач почти бесплатным, самым дефицитным ресурсом станет человеческое доверие и проверка результата. А отсюда уже интересный вопрос: какие навыки в мире агентов подорожают, а какие обесценятся? Авторы заходят неожиданно. Они говорят: забудьте про деление труда на «рутину / не рутину». Главная ось теперь другая — измеримость. Не «насколько задача сложная», а «насколько дёшево её автоматизировать и насколько дёшево потом проверить, что агент не нагородил чуши». И вот тут вся соль. Экономика ИИ подвержена трём системным сбоям, из-за которых привычный расклад «человек контролирует машину» становится нестабильным: 1️⃣ Исчезновение джунов (Missing Junior Loop). ИИ забирает рутину начального уровня. Но именно на ней стажёры и учились, чтобы вырасти в экспертов. Убивая стартовые позиции, мы убиваем конвейер, который готовит будущих сеньоров-проверяющих. 2️⃣ Проклятие кодировщика (Codifier’s Curse). Когда опытный эксперт проверяет ИИ, своими правками он создаёт идеальные данные для обучения машины. То есть эксперт собственными руками ускоряет свою же замену. 3️⃣ Дрейф согласованности (Alignment Drift). Оставшись без присмотра, ИИ начинает «хакать» метрики — формально задачу выполняет, а реальный смысл нарушает (например, прячет свои ошибки ради высокой оценки). Так копится скрытый долг («Троянский конь»), который разъедает экономику изнутри. И всё это не на словах — в статье есть и математика, и графики. Один из них 👇 По горизонтали — стоимость автоматизации задачи (cA), по вертикали — стоимость проверки результата человеком (cH). Две пунктирные линии режут картинку на четыре части: горизонтальная — бюджет на проверку (B), вертикальная — зарплата (w), ниже которой держать человека на задаче дороже, чем её автоматизировать (логично).
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
видео или голосовое, без подписи
Стань волонтером IOAI 2026 и получи международный опыт, сертификат UNESCO, эксклюзивный мерч и многое другое 🌍✨ Места ограничены — заполни анкету и присоединяйся к нам! 📍 Астана 🗓️ 2–8 августа 🇺🇸Английский: В1+ Другие языки приветствуются 🔗 Регистрация
Всем привет 👋 В связи с загруженностью ищу к себе 2–3 помощниц в разные проекты. Работа и проекты растут, и времени уже банально не хватает. Сейчас нужны руки в трёх направлениях: 1. QazTech Meetup — организация тех-митапов совместно с компаниями, на казахском. Из-за нехватки времени стали делать реже (тут всё на казахском). 2. FAIO — международная олимпиада по ИИ среди школьников. Отбор в сентябре, финал где-то октябрь–ноябрь (планируется 20 стран) (тут на 3 языках) 3. F1 — скоро запускаем AI-акселератор для талантливых студентов, ждите анонса (тут каз/рус) Что по сути нужно: помогать в организации. Где-то SMM и написание постов, фотки; где-то кураторство, переписки с компаниями, людьми и даже странами; вести сайты, инсту, каналы и т.д. Главное — инициативность, активность, нетворкинг. И иногда меня доставать, чтобы я там что-то сделал 😅 Работа лайтовая и не частая — в основном во время самих ивентов. И сразу честно: на бесплатной основе. Мне важно, чтобы человеку самому нравились эти проекты и идеи и хотелось ими заниматься. Со своей стороны готов менторить (если вы +- из моей области; если нет — в моём окружении точно найдём таких), а моё время, скажем так, не самое дешёвое)) Плюс получите кучу знакомств и нетворкинга, а как соорганизатор сможете прокачать личный бренд и портфолио. Думаю, плюсов больше 🙌 Зайдёт активным студентам, и не только. Если есть желание — пишите мне в личку. Сразу коротко: кто вы и почему хотите этим заниматься! А если знаете таких людей — смело пересылайте им этот пост, буду благодарен 🙏
Всем привет! Уже совсем скоро отгремит, пожалуй, лучшая ИТ-конфа в Казахстане — Beetech! В этом году я, как обычно, буду там, но уже в совершенно новой для себя роли — в качестве ментора. Решил попробовать этот крутой формат, уверен, будет максимально полезно! Так что, кто хочет попасть ко мне на 1-to-1 менторинг — приходите. Маленький инсайд: как только вам на почту придет инфа со ссылкой на запись, постарайтесь забронировать место сразу. Как показывает практика, слоты разлетаются буквально за 15 минут! ⏳ Дарим промокод для подписчиков Khan of data &analytics на beetech conf со скидкой 25% на билеты: BEEKHANDS25 — отличный повод встретиться с коллегами из ИТ, провести день с максимальной пользой, послушав доклады в стриме Data&AI, и зарядиться на целый год 🚀 В программе: - Илья Красинский (ProductHeroes), Арман Сулейменов (nFactorial), Kolesa Group, Beeline/QazCode, FRHC, и другие сильные эксперты индустрии (24 отборных доклада) - квартирники на холиварные темы - speed-менторинг и полезный нетворкинг - стендап с историями про факапы в IT - лотерея для участников И всё это — за один день 🔥 Купить билет на: www.beetech.kz Обязательно пересылайте этот пост друзьям и коллегам, зовите их пойти вместе!
🚀 Наш проект «Социальный кошелек» вышел в финал международной премии WSIS Prizes 2026! Мы вошли в топ-20 лучших проектов мира в категории e-Government. Сейчас начался этап онлайн-голосования, и нам очень нужна ваша поддержка! Что нужно сделать прямо сейчас: 1. Зарегистрироваться на платформе WSIS (потребуется заполнить ваши данные) 2. Найти наш проект «Social Wallet» в номинации e-Government (AL C7). 3. Проголосовать за него. ⚠️ Важно: Голосование продлится только до 3 мая. Признание со стороны экспертной группы ITU подтверждает, что мы движемся в правильном направлении, создавая стандарты в области GovTech. Победа в премии позволит нам привлечь международное внимание к вопросам социальной инклюзии через цифровые инструменты. Ссылка для регистрации и голосования: https://www.itu.int/net4/wsis/stocktaking/Prizes/2026 Прошу поддержать и проголосовать!
Если на любую задачу вы хотите ответить “давайте просто прикрутим LLM”, этот доклад может быть для вас немного болезненным. Потому что иногда лучший AI-ход — вообще не тащить тяжелую модель туда, где можно обойтись нормальной архитектурой, Python и здравым смыслом. Об этом на Almaty Python Meetup #7 расскажет Мадияр Хамзанов (@mkhamzanov) — Senior AI Engineer / Data Scientist в Caterpillar, ex-Director of Data Science в Forte Bank и сооснователь 10b.kz. На докладе поговорим о том: - как в 10b.kz используют Data-to-Text для генерации инсайтов без тяжелых LLM - как обрабатывают 100 млн записей на 16 ГБ RAM и не падают по OOM - почему кастомный ETL на Python иногда выигрывает у тяжелого стека - как Claude Code и Cursor ускоряют продуктовую аналитику и доставку фич - как из сырого API госзакупок вырастили продукт с 1000+ активных пользователей 🎟 Регистрация: https://forms.gle/EW2NxrUehsV3ya857