tgindex
И

Интересное что-то

описание

Материалы и мысли, понадерганные отовсюду Блог: https://t.me/asisakov_channel Чат: https://t.me/youknowds_chat

623
подписчиков
Охват к подписчикам
23,0%
ERR
Реакции к просмотрам
0,00%
0 на 50 постов
Пересылки к просмотрам
1,43%
99
Постов в день
0,3
всего 889

Где отзываются чаще

доля реакций к просмотрам
  • 15 авг.I just wrote an article about doing evaluations It complements what we studied in the course so I'm sure you'll find it useful https://alexeyondata.substack.com/p/how-to-do-evals-in-2026 Enjoy!0,00%
  • 15 авг.#llm #agents0,00%
  • 8 авг.Привет, друзья! Я очень часто и очень много слышу про SHAP, как про традиционный метод. С традиционностью спорить нельзя — это правда так — безумно сама его люблю. Однако классическая постановка (вот была коалиция, были и есть игроки-признаки) касается только табличного примера и очень плохо показывает, как и почему SHAP переносится на другие модальности и задачи — и какие ограничения это несёт. Что сделала: Вооружившись «загашником» (разговорное: место, куда откладывают что-либо про запас), я свела многое в Хабр-статью: улучшения SHAP от "было" до "стало", со ссылками на все либы и интуицией "что там навешано". В статье и напоминание: классическая формула и SHAP как задача взвешенного МНК, и три вопроса, которые-всех-волнуют и развивают метод. Из вопросов описаны 15 расширений, для каждого — зачем оно возникло, что поменяли и есть ли кодовая реализация. Можно сохранить как шпору и утащить себе список библиотек с SHAP: 1. shap — основная библиотека 2. kernelshap — KernelSHAP для R 3. GPUTreeShap — TreeSHAP на CUDA 4. Fast TreeSHAP — TreeSHAP быстрее на CPU 5. shapley-regression — несмещённый KernelSHAP 6. fastshap — реализация под PyTorch, TensorFlow 7. leverageshap — KernelSHAP с гарантией точности решения 8. sage-importance — глобальная важность 9. shapiq — взаимодействия высших порядков 10. shapr — условные значения Шепли 11. GenAISHAP — Token / Pixel / Video / AgentSHAP 12. mllm-shap — SGPA для аудио Статья на Хабре: https://habr.com/ru/articles/1067656/ Приятного чтения!0,00%
  • 8 авг.#ml0,00%
  • 4 авг.Я принес. Обучение и удержание Сегодня сразу два поста от титана оргпсихологии — Дмитрия Болдырева. Один про то, как строить обучение взрослых людей на работе так, чтобы оно действительно работало: https://t.me/dmiboldyrev/129 Второй про удержание ценного сотрудника: https://t.me/dmiboldyrev/130 Я хочу отметить, что данные посты представляют собой компактные, но по сути довольно емкие чеклисты и инструкции к действию. Для опытных руководителей — это скорее пошаговая напоминалочка ничего не забыть, а для неопытных — дорога, в которой на каждом шаге нужно погрузиться в тему, разобраться, приставить на свой конкретный контекст. И второе, на чтоо хочется обратить внимание — очень реалистичный (у Димы десятки лет обучения за плечами) взгляд на то, какое обучение действительно будет работать. Не для галочки, не как «бенефит от компании», не такое, на которое отправили на перевоспитание, а такое, чтобы и человек сам захотел научиться, и полученные знания перешли в навыки, приносящие пользу на работе. Внимание, спойлер: одна учебная сессия на 2-3 часа этого не дает, как надеются некоторые. А про удержание сотрудника — так это вообще сказка-песня. Оказывается, нельзя просто повысить зарплату, или похлопать по плечу, или наоборот поругать, и проблема рассосется. Человеки очень сложные, к ним нужен комплексный персональный подход, и особенно это касается тимлидов, которые управляют непосредственно исполнителями с мало прокачанными пипл-менеджерскими навыками. Мидл-менеджерам как будто бы тут попроще, ведь у них в подчинении другие руководители.0,00%
  • 4 авг.#softskills0,00%
  • 29 июл.Топ каверзных вопросов по статистике с собеседований. Часть 2 Продолжение разбора вопросов, вторая часть. Первая часть была здесь. Поехали! 🟡Дизайн готов, A/B тест запущен. Продакт волнуется и смотрит результаты каждый день, в один день пишет, что ключевая метрика статистически значимо упала, надо отключать. Что делаем? Тут спрятаны сразу две ловушки: 1. Проблема подглядывания. Нельзя смотреть результаты каждый день и принимать решения по первому стат значимому результату, если в дизайне теста изначально не было заложено последовательное тестирование. При таком принципе оценивания теста вероятность ложного прокраса в любую сторону стремительно растет. 2. Экстренная остановка. Важно не путать это с пунктом 1. Корректный критерий аварийной остановки закладывается заранее и обычно не завязан на пересчет p-value день в день, иначе он страдает от той же проблемы подглядывания. Обычно это простой практический порог: метрика упала на конкретное число процентов, выросло число ошибок, начались краши, возможно мы выкатили критический баг 😬. Если продакт увидел на платформе A/B статистически значимое падение без такого заранее согласованного порога, то это все еще подглядывание в результаты A/B. В хорошем ответе для собеседования нужно четко разделить два случая. Стоит подчеркнуть недопустимость подглядывания без специального дизайна, но обязательно сказать про возможность ранней остановки теста при критическом падении ключевых или заградительных метрик. 🟡Тест завершен, анализируем 5 ключевых метрик. Одна из них статистически значимо изменилась, p-value = 0.03. Выкатываем тест? Для внимательных читателей канала вопрос очевидный, это ловушка на множественное тестирование. Конечно, если мы тестируем 5 ключевых метрик, то вероятность совершить ложное открытие повышается, поэтому нужно использовать поправку на множественное тестирование или принимать решение только по одной ключевой метрике. Из поправок обычно достаточно назвать Бонферрони или Холма, а вот FDR я бы сильно не рекомендовала упоминать и применять. Подробнее писала про поправки здесь, а вот здесь есть мощный технический разбор FWER на зависимых тестах 🟡Распределение p-value при A/A тесте Этот вопрос посоветовали в комментариях к предыдущей части, тоже нередко встречается. Тут нужно вспомнить, какая гипотеза верна при A/A тесте. Так как отличий на самом деле нет, то верна нулевая гипотеза. Ожидаемое распределение p-value при верности нулевой гипотезы равномерное на отрезке от 0 до 1. Это можно увидеть на симуляциях, например здесь Пишите в комментарии, на сколько вопросов из обеих частей удалось ответить без подглядывания! И делитесь, про что было бы интересно почитать еще 👇 #analytics #собес_PA0,00%
  • 29 июл.#interview #ab #statistics0,00%
  • 27 июл.https://www.youtube.com/watch?v=rnDm57Py54A0,00%
  • 27 июл.#llm #agents #petproject0,00%
  • 26 июл.Топ каверзных вопросов по статистике с собеседований. Часть 1 Сегодня разберем самые интересные, на мой взгляд, вопросы и типичные ловушки. В изначальной версии получилось довольно много, поэтому мне посоветовали разделить пост на два. Правильные ответы спрятала под спойлером, попробуйте сначала ответить сами. Здесь не будет вопросов "что такое p-value" или "что такое доверительный интервал". Хотя они могут встретиться на HR-скринингах, на техническом интервью обычно вопросы поинтереснее. Отмечайте, сколько из этих вопросов вам уже попадалось 👇 Поехали! 🟡От чего зависит размер выборки? Иногда могут спросить формулу MDE, что в числителе, а что в знаменателе. Можно назвать сразу все 4 параметра: MDE (минимально детектируемый эффект), дисперсия, уровень значимости и мощность. Обычно уровень значимости и мощность фиксированы, размер выборки в основном зависит от дисперсии и MDE. Для непрерывных метрик, таких как ARPPU, характерна высокая дисперсия из-за длинного хвоста, что увеличивает время проведения тестов. Для непрерывных метрик дисперсия и среднее это независимые параметры. Бонусный вопрос: как считается дисперсия для конверсионных метрик? Для биномиального распределения дисперсия напрямую зависит от значения среднего по формуле `p(1−p)`. 🟡Что такое ошибка первого и второго рода и какая из них хуже на практике? Как связаны ошибка первого рода и уровень значимости? Ошибка первого рода — ложноположительный результат (нашли эффект, которого нет), ошибка второго рода — ложноотрицательный результат, не обнаружили реальный эффект (тут моя любимая картинка-мнемоническое правило). Какая ошибка хуже зависит от конкретного кейса, нельзя дать универсальный ответ. В медицинской диагностике ложноположительный результат почти всегда более безопасен, чем ложноотрицательный, лучше перепровериться, чем пропустить болезнь. В A/B тестировании по-разному, не заметить положительный эффект фичи может быть хуже чем раскатить нейтральную, а может и наоборот, нейтральные фичи усложняют поддержку, кодовую базу, а влияние на метрики не имеют. Уровень значимости - верхняя граница вероятности ошибки первого рода. Подробнее про это и связь их между собой здесь. 🟡Приготовили дизайн A/B, но тест идет долго, например больше месяца, продакт просит ускорить его. Что делать? Есть ряд способов ускорения A/B, например через снижение дисперсии: CUPED и стратификация. Кроме этого, можно использовать последовательное тестирование, но с этим есть нюансы, планирую разобрать это в одном из следующих постов. Еще один способ - рассмотреть вариант с прокси-метриками. В крайнем случае можно увеличить MDE, сократив выборку и ускорив тест, но продакта нужно предупредить, что мелкие изменения теперь не засечем. На тему ускорения A/B можно делать не один пост, здесь будет только нужная информация для старта. Вторая часть с вопросами выйдет завтра, накидайте лайков, если формат понравился ❤️ Пишите в комментарии вопросы, с которыми сталкивались! #analytics #собес_PA0,00%
  • 26 июл.#interview #statistics0,00%