tgindex
DziS Science | Data Science

DziS Science | Data Science

Статистика

Канал о жизни через призму науки о данных Учусь сам, учу других Пишу интересные статьи о соревновательном и коммерческом DS и его приложениях к жизни. Создатель: @a_dzis

Последний пост
12 авг.
Последнее чтение
21:06
Постов за неделю
1
Всего постов
122
Тип
открытый
Язык
русский
Категория
Приложения
В каталоге с
12 авг.
Подписчики
2 205
+5 за 4 дн.
Сутки
+1
+0,05%
Неделя
 
Месяц
 
Просмотров на пост
477
40 постов
Вовлечённость
21,6%
к подписчикам
Постов в день
0,1
всего 122
Упоминаний
7
каналов
Охват размещения
оценка
1/24сутки в ленте
215
1/48двое суток
246
1/72трое суток
265

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • Привет всем! 👋 Недавно я разбирал программу Яндекса 75/75/75 и закончил мысль тем, что идея нравится, а как она поведёт себя в реальности — вопрос времени. Но одно дело внедрять ИИ, а совсем другое — понимать, как он меняет инженерные процессы и влияет на аспекты разработки 5 сентября Яндекс проводит deep tech night — конференцию о технологических вызовах в эпоху AI. AI тут не просто «одна из тем программы». Это ровно тот триггер, который переписывает инфраструктуру, архитектуру, процессы разработки и сам способ ставить задачи. У меня этот сдвиг случился на соревновании ROGII: 90% работы сделал Claude Code, а я по факту сидел тимлидом у агента и разгребал потерю контекста в логах. Ощущение специфическое, и навыки под него нужны другие, плюс недавно при общении с достаточно высокостоящими людьми в индустрии, я понял что почти все уже дрейфуют в сторону ИИзации. Обещают реальные кейсы команд и доклады на стыке AI, разработки, инфраструктуры и данных: среди выступающих как российские спикеры, так и приглашенный эксперт. - Кто у микрофона? 🎤 🔸 Мо Гавдат, ex-Chief Business Officer Google X — что будет после первого поколения AI-систем и куда эволюционируют инженерные команды. 🔸 Алексей Гусаков, CTO Бизнес-группы Поисковых сервисов и ИИ в Яндексе — переход от классического ML к генеративным моделям в рекомендательных системах. 🔸 Сергей Мельник, руководитель сервиса автономного транспорта и роботов — Physical AI: как построить стек и запустить его в реальных условиях. Это лишь часть докладов, полную программу можете посмотреть на сайте. В онлайне будут доступны Hard-трек с техническими докладами и Q&A-сессия с экспертами. Офлайн тоже есть, про участие в очном формате можете почитать подробнее на сайте. Лично мне интереснее всего разбор про генеративки в рекомендациях: учитывая, что SOTA решения в рекомендациях не используют такой тип моделей, то это тот случай, когда «поменяли модель» на практике означает «переписали половину пайплайна», и хочется услышать, чем платили за переход. Ну и C-level Google, конечно же, не каждый день люди такого уровня выступают. Зарегистрироваться на трансляцию

  • Привет всем!👋 🚨Новое соревнование на Kaggle!🚨 На платформе стартовало соревнование Kaggriculture. Буквально веселый фермер, только ИИ версия. От старта соревнования прошло 10 дней, но соревнование симуляционное, так что времени на подготовку у вас предостаточно.🐱…

  • 9 авг.402414

    Привет всем!👋 🚨Новое соревнование на Kaggle!🚨 На платформе стартовало соревнование Kaggriculture. Буквально веселый фермер, только ИИ версия. От старта соревнования прошло 10 дней, но соревнование симуляционное, так что времени на подготовку у вас предостаточно.🐱 Лично я рассматриваю это соревнование как отдушину от лютого стака моделей в ROGII, где можно почилить и попилить RL стратегии. -В чём задача?🚜 Здесь всё максимально нетривиально: нужно построить автономного AI-агента, который управляет виртуальной фермой — сажает и собирает урожай, ухаживает за скотом, нанимает работников, расширяет земельные участки и торгует на динамическом рынке, где цены реагируют на спрос и предложение. Соревнование организовано Kaggle совместно с Google. - Что по механике?🤨 Одна игра - это сезон длиной 30 дней (720 ходов, ход = игровой час). Ваши агенты играют лестничные (ladder) матчи против других участников, и по итогам каждой партии обновляется рейтинг. По каждому завершённому эпизоду доступен полный реплей - все наблюдения и действия обоих игроков по ходам, так что материала для анализа чужих стратегий будет более чем достаточно. Это скорее не классический supervised-таск, а стратегическая симуляция уровня Lux AI / Halite - заходит тем, кому интересны agentic AI, планирование и multi-agent взаимодействие. Призовые💰 Общий призовой фонд - $50,000. Распределение простое: 🏅 Топ-10 команд получают по $5,000 каждая. - Что по метрике?🎯 Метрика тоже нестандартная - это не RMSE и не accuracy, а итоговый банк (доход) вашего агента по итогам партии на лестнице, из которого и складывается рейтинг. - Что по срокам?📆 🔸Дедлайн регистрации/объединения в команды: 24 сентября 2026 Раз метрика - это доход агента в динамичной экономике, чистый RL «в лоб» может не зайти лучше эвристик — рынок и ограниченные ресурсы (земля, рабочие руки) сильно влияют на стратегию. Тестируйте разные подходы: от rule-based ботов до полноценных RL-агентов, комбинируйте их и смотрите реплеи чужих матчей - там реально можно многое подсмотреть. #соревнования

  • 8 авг.439113

    Привет всем!👋 Сегодня на IT-Пикнике залетел на сходку Саши Абрамова (ака Dealer.ai) Замучил вопросами про карьеру и получил лично от него мерч Вкусвилла. #life

  • 6 авг.493142

    2/2 Архитектура итогового сабмита: Два независимых стека, финальный бленд: 🔸Part A - физика. 128-сидовый likelihood-weighted particle filter (ANCC-anchored, Z-velocity coupled, numba), поверх — селектор кандидатных путей + robust low-degree полиномиальная проекция. На выходе anchor. 🔸Part B - ML-стек (fleongg). LGBM×3 + CatBoost×2 + Ridge-мета. Ключевая инженерная деталь - два спатиальных импьютера, FormationPlaneKNN и DenseANCCImputer, которые тянут признаки формаций (ANCC/ASTNU/…, есть только в train) с ближайших соседних скважин; на train-объектах вызываются с self_wid, который исключает саму скважину из выдачи соседей. Поверх - physfeats: self-log + neighbor-dip признаки, инъекция весом W_HARD=0.3 в финал ветки. Поверх обеих веток: 🔸 HMM (forward-backward, self-log emission), вес HMM_W 🔸 kriging по датум-сдвигу b_w (locked-конфиг: TH=2.2166, ANISO=2.0, RNG=500, K=25, anisotropic variogram), вес krige_w; работает только за счёт соседей ближе ~500 ft (при исключении их из lookup сигнал схлопывается) 🔸 gold/contact-override - прямое восстановление TVT из формаций для скважин-дублей train <-> hidden 🔸 seed-branch hedge: когда посмертное распределение 128 PF-сидов бимодально (masса меньшей моды ≥0.25, разделение мод 4–40 ft), сдвигаем предсказание к взвешенной середине веток, капом ±2 ft; срабатывает на ~12% скважин Финальная формула: pred = w_sp45·[(1−HMM_W)·anchor + HMM_W·hmm] + (1−w_sp45)·fleongg, затем + krige-сдвиг, + gold-override, + seed-hedge. Валидация: Итоговые веса финального сабмита были заточены под кросс-валидацию с GroupKFold(folds=5) по скважинам, при этом валидация была настроена для каждой части отдельно, итоговая валидация всей модели делалась на пересечении (по итогу на CV оценивались 370 скважин). Как показали результаты, CV отлично коррелировала с Private (итогова модель имела 9.004 против 9.038 на Private), но корреляция с LB была отрицательная, что и привело к огромному LB шафлу после соревнования. Главный вывод: Trust Your CV. Public LB - маленькая (52 скважины), шумная подвыборка скрытого теста; CV370 - выборка на порядок больше. Ретроспективная проверка на private-скорах топ-89 сабмитов дала корреляцию Pearson +0.90 между CV и private LB - и отрицательную (−0.61) между public LB и private. Несколько раз в процессе мы отказывались от CV-оптимальных конфигов в пользу тех, что лучше смотрелись на public LB - и каждый раз это было ошибкой в противоположную от истины сторону. Смелая попытка довериться CV до конца, невзирая на посредственный public-скор, принесла +168 позиций и бронзу. При этом ни оверфита, ни случайного выброса не произошло именно благодаря стабильности этой CV: 370 скважин с честными групповыми фолдами - выборка того же порядка, что и сам скрытый тест, поэтому и скачок получился большим, но объяснимым по величине, а не подарком генератора случайных чисел. #соревнования

  • 6 авг.416136

    1/2 Привет всем!👋 Вчера закончилось соревнование - ROGII - Wellbore Geology Prediction. По результату соревнования наша команда забрала бронзу 🥉 заняв 525/6191 место. На Private LB мы поднялись на 168 мест. Немного предыстории: Я начал соревнование соло, но после общения в чате Псевдолейблинга на меня вышел парень, который слушал мое выступление в МФТИ "Я профессионал" и предложил поучаствовать вместе. Я согласился, также в рамках соревнования я начал впервые активно использовать вайбкодинг. Fun Fact: Это соревнование - первое мое соревнование, в котором 90% работы за меня выполнил Claude Code. Времени много кодить у меня не было, благодаря Claude я делал вечером дела в параллель, высвободив себе немного свободного времени, по сути руководя им как тимлид. Мы сделали довольно таки годный репозиторий, в который каждый сабмит и прогон логировался с комментариями, сохраняя версию ноутбука, проверяя кросс валидацию. Из смешного: файл с логированием сабмитов submission_history.csv начинался строго на английском, имел четкий численный идентификатор эксперимента (exp_001), но в конце уже полностью перешел на русский с потерей четкой структуры идентификации. Множественная потеря контекста привела к хаосу в документе и его пришлось в момент переписывать, это достаточно забавно. Fun Fact: Название команды было предложено не мной, только в процессе работы я узнал, что это оказывается довольно-таки нишевый исполнитель. Об экспериментах: Их было много, спаршены все топ паблик кернелы, сгенерированы признаки из подсказок в discussions (далее по тексту physfeats), даже попробованы нейросетевые подходы. Топ-1 взяла UNet архитектура, мы тоже ее пробовали, но при увеличении кол-ва скважин, модель банально взрывалась по метрикам, побороть это нам не удалось. Об итоговом сабмите: Fun Fact: Сабмит, который принес нам бронзу был сделан последним, за пару часов до дедлайна. Он на Private показал топ-1 скор из всех, что у нас были. По итогу, бросив нейросетевые подходы (решения аналогичного соревнования прошлого года и архитектура с Attention, Unet, поиск предобученных на HF), мы остановились на бленде из классических моделей (линейки, бустинги) с физическими фильтрами. Последние дни боролись именно за стабильность решения, в т.ч используя усреднение предсказаний по куче сидов (да-да finetuning сидов это база для Kaggle). О архитектуре итогового сабмита и выводах ниже⬇️⬇️⬇️ #соревнования

  • 6 авг.417365

    СЮДА БЛИН, LET’S GO Пост нормальный завтра напишу уже, как проснусь #соревнования UPD: Никнейм придумал тиммейт, я в душе не чаю кто этот ваш королевский 17.

  • 3 авг.4091010из not_boring_ds

    От стажёра до Head of DS: что я узнал, изучив почти 700 карьер в Data Science 🧬 Наконец-то дождались 🗿 Чуть больше года назад вы заполнили мой зарплатный опрос. Я обещал проанализировать результаты, но 695 анкет превратились в технический долг, о котором мне регулярно напоминали в комментариях. Сегодня я этот долг возвращаю. Кажется, даже с процентами: вместо очередной таблицы «кто сколько получает» получилось большое исследование карьер в Data Science. Да, за прошедшее время зарплатные вилки успели сдвинуться. Но карьерные зависимости никуда не делись, поэтому статья не только о суммах, а о профессиональном росте, удовлетворённости работой и готовности её сменить. Внутри вас ждет лонгрид, где в том числе есть ответы на пять не самых очевидных вопросов: 1️⃣ Можно ли удержать недовольного дата-сайентиста высокой зарплатой и запереть его в золотой клетке? 2️⃣ Какие навыки помогут быстрее вырасти в грейде и больше зарабатывать? 3️⃣ Одинаково ли зарабатывают мужчины и женщины с одним грейдом и опытом? 4️⃣ Что дата-сайентисты хотят сказать Head of DS, когда отвечают анонимно? 5️⃣ Как часто дата-сайентисты *** и связано ли это с доходом и удовлетворённостью работой? Ещё там премии стажёров, ШАД на скейтборде, зарплата CDS до 4,5 млн рублей 😳, переработки и попытка понять, где заканчивается развитие и начинается менеджмент. В анализ вошли 694 анкеты. Спасибо «Start Career in DS», «DziS Science | Data Science», «girafe.ai», «Artificial stupidity», «LightAutoML framework» и «Борис опять» 👉 Читать на Хабре

  • Всем привет!👋 Мы дождались, обзор на вилки вышел! #карьера

  • Привет всем!👋 Сегодня одним из главных челленджей создания стратегии внедрения ИИ является постановка правильных и адекватных KPI для улучшения процессов без ущерба качеству. И мне всегда интересно, что для этого делают на рынке. Яндекс запускает программу 75/75/75, которая должна сделать ИИ новым стандартом разработки внутри компании. И это, пожалуй, один из самых прямолинейных KPI по внедрению ИИ, что я видел. - Что значат эти цифры? 🔸К концу 2026 года 75% процентов разработчиков будут использовать ИИ инструментарий для написания кода. 🔸ИИ должен принимать участие не менее, чем в 75% изменений в кодовой базе. 🔸В этих 75% изменений 75% процентов кода должно быть сгенерировано ИИ. Выглядит как массовая ИИ-трансформация работы сотрудников, в которой классическая разработка остается только в редких, я бы даже сказал, особенных случаях. Во остальных ситуациях подразумевается, что разработчик уже выступает в роли Product Engineer, т.е продукт лидируется человеком с точки зрения кода и бизнеса, но реализация возлагается на агентов. - Какие вводные сейчас уже имеются? Сегодня 73% разработчиков Яндекса регулярно используют ИИ, а более 50% нового кода в компании создается с помощью генеративных моделей. При этом наибольшей эффективности достигают команды, где ИИ встроен в повседневный процесс разработки и используется при подготовке не менее 75% изменений кода. Сегодня так работают 17,2% разработчиков — за последний месяц их доля выросла более чем вдвое по сравнению с прошлым кварталом. То есть стратегия 75/75/75 уже имеет место быть в Яндексе, но до целевых показателей еще далеко. Поэтому следующий этап - масштабировать этот подход на всю компанию. - Есть ли реальные кейсы, когда такой подход помог ускорить разработку? 🔸 Яндекс Еда — создание ИИ-хостес за 2 месяца, разработка итогового продукта ускорилась в 2 раза 🔸Яндекс Браузер — 80% кода новой архитектуры перевода видео от ИИ, вместо 2-3 недель — 2 дня 🔸Яндекс Лавка — кабинет франчайзи собрал один человек за 3 недели, спринты ускорились в 3,3 раза Ответственность за реализацию и архитектуру всё еще остается на человеке. Подразумевается, что ИИ берет на себя именно рутинную разработку. И это переворачивает игру. Сдвиг рынка происходит в сторону специалистов, отлично умеющих в архитектуру и код-ревью. При этом функции тимлида начинают выполнять гораздо больше инженеров: каждый «агентовод» становится своего рода руководителем собственной команды ИИ-помощников. Вот тут интересно, как в данной парадигме будет происходит обучение и рост сотрудников (а компания, по последним новостям, планирует нанять рекордные 3200 стажеров в 2026 году), ведь больше кода, больше проектов требует больше операторов ИИ, но если сразу взять курс на "сеньорность", то произойдет кадровый разрыв. - Как достигаются такие цифры? Яндекс также активно развивает внутренних агентов и агентские платформы, которые направлены не только на разработчиков, а на всех сотрудников, например на бизнес аналитиков, продактов. Из примеров внутренних агентов: 🔸GENA - сама доводит тикеты до готового кода 🔸"Стефания" - работает виртуальным сотрудником для 5 тысяч человек в неделю Платформы для внешней аудитории: 🔸SourceCraft - платформа с встроенным агентским режимом для кода 🔸Yandex AI Studio - платформа для создания ИИ-агентов и приложений Интересным является то, что платформенные решения сразу упаковываются в продукты для рынка. По-моему, это круто, учитывая, что у нас только начали появляться инструменты, разработанные в РФ, которые потенциально могут на дистанции составить конкуренцию зарубежным решениям. Да, всем очевидно, что условноза неделю LLMки не обучишь, но любой шаг в этом направлении - шаг к тому, чтобы громко заявить о себе. Мне нравится идея программы, но как она покажет себя в реальности - вопрос времени.

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • Привет всем! 👋 Прямое включение из отпуска. Нижний Новгород - классный город. Красивые закаты, вкусная еда. Из минусов только колени - в среднем за день часы показывают 40+ пройденных этажей (кстати Кремль мы прошли полностью по кругу с перепадами высоты, аналогичными 20ти этажному дому). Fun Fact: В Нижнем Новгороде есть довольно-таки большой аквапарк. Принципиально выключился из какой-то профессиональной движухи на неделю, надо немного перезагрузиться. Так что ждите новостей, думаю со следующей недели. А на десерт ловите фотоотчет. #офтоп #life