tgindex
Depeche Prod
@depecheprodрусский

Хард сайенс продуктового менеджмента

Последний пост
14 июл.
Последнее чтение
15 авг.
Постов за неделю
0
Всего постов
20
Тип
открытый
Язык
русский
В каталоге с
12 авг.
Подписчики
92
0 за 3 дн.
Сутки
0
0,00%
Неделя
 
Месяц
 
Просмотров на пост
237
20 постов
Вовлечённость
257,6%
к подписчикам
Постов в день
0,0
всего 20
Упоминаний
2
каналов
Охват размещения
оценка
1/24сутки в ленте
1/48двое суток
1/72трое суток

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • Немного про контрольные карты Если не чинить то, что сломано — это очевидно плохо, то еще хуже чинить то, что не сломано. Понять когда метрика действительно изменилась — не всегда тривиальная задача. В процесс вмешивается естественная вариативность метрики, неконтролируемые условия, сезонность. И первое, что приходит на ум — это построить доверительный интервал. Это хорошая практика про которую многие забывают: без доверительного интервала, метрика — не более чем догадка, которое не несет информации о вариативности. В статистике это называется «точечной оценкой» (point estimate). Доверительный интервал отвечает на важный вопрос вопрос: в каком диапазоне лежит настоящее значение (true value) среднего, конверсии или любой другой метрики. То есть это точечная оценка, основанная на выборке + некоторая ошибка измерений с заданным параметром «уверенности». Знание о возможном диапазоне исследуемой метрики уже говорит о многом: например если вы знаете, что для пуш-нотификаций в вашем приложении opt-out rate составляет 10%±3%p, то у вас есть железный аргумент для обеспокоенного маркетолога, который регистрирует его рост до 12% за месяц. Однако, поскольку доверительный интервал строится вокруг точечной оценки, которая может меняться сама по себе со временем, этот метод может подвести. Поэтому можно попробовать построить временной ряд для метрики, отметив доверительный интервал на всем его протяжении. Однако, такой подход не дает понимания что есть норма. Доверительный интервал – это инференционная практика, которая говорит о точности наших оценок и не более того, но никак не дает им качественной характеристики. Для качественной оценки процесса (например: хуже/лучше) подойдет весьма известный метод, который широко используется на бережливом производстве еще с середины прошлого века — контрольные карты. Концепция контрольных карт подразумевает ценную качественную оценку процесса: его управляемость. Под управляемостью понимается возможность использовать прошлый опыт, чтобы понять в каких пределах и какие вариации процесса можно ожидать в будущем. Фактически — экстраполировать прошлый период на будущее. Карты отвечают на вопрос: «изменился ли процесс?» Структура контрольной карты проста: есть центральная линия, описывающая среднее процесса, есть верхняя и нижняя границы. Между этими линиями отмечаются точки данных вашей метрики, в случае, если метрика пересекает одну из граничных линий, это говорит о том, что процесс изменился: соответственно в худшую или лучшую стороны. В отличие от классических статистических методов, метод контрольных карт больше напоминает эвритстику и мне потребовалось довольно глубоко погрузиться в литературу, чтобы понять природу коэффициентов, используемых в формулах. ✝️Знакомые с концепцией последовательных (seqential) A/B тестов наверняка увидели сходство описания контрольных карт и SPRT-теста. И в целом, это верная интуиция. С некоторыми оговорками, про контрольные карты можно думать как про последовательный тест, однако весьма грубый. Из всего многообразия контрольных карт, для цифровых продуктов лучше всего подходят MR-карты. Их можно использовать как с непрерывными значениями, так и с дискретными или бинарными. Реализация несложная и статьи на вики хватит для того, чтобы попробовать построить первую контрольную карту. Контрольные карты тем робастнее, чем стабильнее процесс, поэтому не всегда их можно надежно применить, когда сам процесс естественно волатилен — в этом случае придется часто менять стартовый период, который «управляем» — то есть наилучшим образом описывает вариацию процесса за период. В традиционно-стабильных доменах, например связанных с оплатами, биллингом или для телеметрии инфраструктуры метод полезен для разработки HelthCheck дашбордов.

  • Совершенно случайно обнаружил, что моя книжная полка сама по себе создала ребус. Попробуйте отгадать, какая управленческая максима зашифрована на картинке

  • видео или голосовое, без подписи

  • видео или голосовое, без подписи

  • 1 апр.27310из forallxyz

    Математики 1 апреля #математика #юмор

  • 🤡

  • Из мухи слона: инкрементальность в продуктовой разработке Я думаю, что все, кто знаком с гибкими методологиями разработки, видели картинку, на которой сперва у вас скейтборд, затем самокат, велосипед и далее — автомобиль. Эта метафора инкрементальности оказалась потрясающе популярной и понятной, и как часто бывает с популярными и понятными вещами: также совершенно неправильной. Инкрементальный подход позволяет не знать, насколько ваша фича разрастется «в ширину», ограничиваясь пониманием того, как будет выглядеть лишь следующий шаг. Однако это никак не избавляет от необходимости определить и зафиксировать цель, к которой продуктовая команда хочет прийти. ✝️Любопытно, что про инкрементальность, можно думать с точки зрения классической математической задачи — Gambler’s ruin (с поправкой на разную природу игр). В таком контексте — этот подход позволяет контролировать размер ставки, соответственно, снижая риск продуктовой команды и бизнеса, который за это платит. (Подробнее об этом можно прочитать на канале Системный сдвиг) Возвращаясь к картинке: мы видим четыре принципиально разных устройства: скейт, самокат, велосипед и автомобиль. И это все что угодно, но не инкрементальный прогресс: это дыхание Чейна-Стокса у фирмы, которая мечется между производством самокатов, скейтов и автомобилей. Самокат можно сделать только из самоката, велосипед только из велосипеда, а автомобиль — исключительно из автомобиля. Если вы в самокатном производстве, то вы можете сделать самый лучший самокат в индустрии, возможно, даже самый бесячий — с электромотором, но именно самокат будет конечной формой вашего продукта. Если у вас уже есть самокат и вы хотите сделать автомобиль, ну что же: теперь вы должны выбросить самокат и начать делать автомобиль. Инкрементальный подход — про расширение, а не про дрейф от одной цели к другой, совершенно отличающейся. К сожалению, на практике, я вижу, что инкрементальность воспринимается многими продактами и стейкхолдерами, как всепрощающая методология, индульгенция, которая избавляет от бремени формулирования конечной цели. Кстати, этот пост я писал тоже инкрементально: постепенно изменяя и переписывая, чтобы лучше донести свою мысль про инкрементальные практики в разработке. Согласитесь, было бы странно ожидать, что при таком подходе пост превратится в обзор методов лечения гастрита? Актуальный пример — это AI ассистенты. Я уверен, что каждый продакт сможет вспомнить пару примеров, когда этот функционал добавлялся как бы «сбоку», абы было. Позже, все эти наработки полностью идут прахом, когда у фирмы появляется понимание того, как при помощи AI создавать ценность: например, построить на нем целый пользовательский опыт или глубоко интегрировать в платформу. И я уверен, что в этот момент на встрече с CPO звучит сакральное: «инкрементально» Каждый компонент системы имеет предел до которого его можно развивать наслаиванием. Иногда "инкрементально" конфликтует с "иначе" и бывает, что выкинуть фичу или полностью заменить опыт целиком — это правильное решение. Не менее важно, чтобы это решение было осознанным и соответствовало ожиданиям всех заинтересеванных сторон: если полная переработка происходит вопреки ожиданиям, увеличивая сроки деливери, или же вам кажется, что вы натягиваете сову на глобус, пытаясь совместить несовместимое — кто-то из стейкхолдеров хочет получить автомобиль из самоката или сделать из мухи слона. #product_management #it #пользователи

  • видео или голосовое, без подписи

  • Первая картинка — типичные пространственные отклонения, которые мы замечаем. Вторая картинка — показывает чем острота зрения отличается от пространственной остроты: грубо говоря, чтобы явно различить две точки (а не увидеть одну вытянутую), они должны быть разделены некоторым расстроянием (на картинке — это одна гексагональная клетка) Но чтобы увидеть что одна точка находится выше другой, расстояние может быть значительно меньше

  • Почему интерфейс приложения выглядит неаккуратно и при чем тут миллениалы и штангенциркуль? Этот пост — реакция на дискуссию, которая произошла у меня на работе по поводу обоснованности pixel-perfect верстки и на мем, который я увидел в другом уважаемом канале. Острота чувств определяется тем, насколько маленькие детали мы можем различить. Например, коль скоро мы говорим про визуальную составляющую приложения, острота зрения — это наша способность визуально отделить одну точку от другой: например две звезды на небе могут сливаться в одну в зависимости от их взаимного расположения, дистанции и оптических особенностей глаза, буквы на таблице Сивцева (ШБМНК…) начинают размываться на определенной строчке и становиться неразличимыми etc. Можно сказать, что острота зрения — это как разрешение монитора: чем оно ниже, тем меньше тонких деталей мы можем увидеть и наоборот. Однако, человеческий глаз обладает и остротой другой модальности – пространственной. В англоязычной литературе, такой феномен получил название hyperacuity — гиперострота. Продолжая метафору с разрешением: если «обычная» острота зрения ограничена плотностью «пикселей» нашей сетчатки – фоторецепторов, то пространственная острота позволяет видеть «субпиксельные» различия. «Субпиксельные различия» – это способность замечать несоосность двух линий, кривизну или отсутствие центровки (см. картинку) Если попытаться оценить различия этих модальностей количественно, то исследования, которые я нашел, заявляют о том, что наш глаз может различить объекты, разделенные 30-60 угловыми секундами, и отклонения в 5 угловых секунд для пространственных отличий ✝️Чтобы лучше понять масштаб различий: способности различать объекты, разделенные 30-60 угловыми секундами (0.5-1 MOA) достаточно, чтобы разглядеть черты лица человека на расстоянии 150 метров, а разрешающей способности в 5 угловых секунд – достаточно, чтобы разглядеть монетку на расстоянии 400 метров. Мы никогда не увидим монетку с такого расстояния, но даже малейшая неточность пространственного расположения будет бросаться в глаза. Этот эффект получил применение в нониусной шкале (шкале Вернера) для штангенциркулей, а знаменитый фокус с шоколадкой эксплуатирует эту идею за пределами видимых глазом различий. Поэтому «ад перфекциониста» – это не выдумка миллениалов, это действительность, которую замечает любой зрячий человек (простите, миллениалы). Современные инструменты для проектирования и имплементации UI отлично справляются и с выравниванием и с центровкой и конечно же умеют рисовать прямые линии без изломов. Алгоритмы сглаживания позволяют избавиться от «лесенок» по краям, и современные дисплеи способны гарантировать избыточную плотность пикселей Однако, некоторые интерфейсы продолжают выглядеть неаккуратно. Как я писал ранее, дизайн — это (эмерджентная) система. И адекватная реализация каждого дискретного компонента системы не гарантирует того, что вся система будет выглядеть хорошо. Когда мы смотрим на экран, содержащий несколько различных компонентов, каждый может быть сверстан корректно, но между ними, например, не будет сквозной симметрии. Этот эффект неплохо изучен в психологии и в научных работах по компьютерной графике и называется гештальт-эффектом (можно посмотреть статью Якоба Нильсена на эту тему): суть эффекта в том, что мы склонны проводить мнимые линии, границы там, где их нет. И когда глазу не получается продолжить воображаемую соосную линию, возникает чувство дискомфорта и общей неаккуратности интерфейса. Pixel-perfect практика позволяет контролировать эти небольшие флуктуации и целостность системы элементов на одном экране. Конечно, не всегда получается ей следовать, как по техническим причинам или по причинам экономической целесообразности, но точно никогда не стоит пренебрегать этой практикой, если вам кажется, что маленькие погрешности в верстке окажутся незамеченными. #product_management #it #UI #UX #design #дизайн

  • Построить unit-экономику, вырастить ретеншн и посадить дерево метрик У всех бывает, но не у всех проходит. Любой продакт использовал RICE, любой пытался переписывать требования в формате Job Stories, и уж наверняка, мучал своих пользователей «проблемными»…

  • Представьте, что есть дерево метрик от метрики A до метрики M, рассмотрим пограничные значения: Левый верхний квадрант: предсказанная А при изменении метрики B — точки настоящих значений A находятся очень близко к прямой (предсказанная A), низкий уровень дисперсии, высокая надежность предсказания Нижний правый квадрант: предсказанная A при изменении метрики M — точки реальных значений A находятся едва ли не по всей площади графика, высокий уровень дисперсии, низкий уровень надежности предсказания

  • Построить unit-экономику, вырастить ретеншн и посадить дерево метрик У всех бывает, но не у всех проходит. Любой продакт использовал RICE, любой пытался переписывать требования в формате Job Stories, и уж наверняка, мучал своих пользователей «проблемными» или «решенческими» интервью, иногда совмещая оба подхода сразу! В списке продуктовых клише особняком стоит любовь к построению деревьев метрик. Дерево метрик — это стандарт. Без дерева метрик от вашего приложения будут отваливаться кнопки и сыпаться прямо на столы и в карманы пользователей, а backend перепишется с C# на 1С. И не родился еще такой продакт, который смог бы подтвердить обратное — деревья метрик рисуют абсолютно все. Я не планирую развенчивать концепцию дерева метрик — однако хочу показать границы, в которых эта модель работает хорошо и в которых требует более глубокого понимания своей природы. Я предлагаю думать про дерево метрик так: — Это иерархическая модель метрик продукта — Это Path Model каузального взаимодействия метрик продукта Иерархическую модель метрик не всегда просто построить, но всегда просто интерпретировать. Если вы договорились об NSM, OMTM и ключевых драйверах их роста — вы уже получили простой ответ на сложный вопрос: что для вашего продукта важно. Однако, редко кто довольствуется формулой «Метрика 1 важнее, чем Метрика 2». Бизнесу интересно другое: «Если Метрика 2 увеличится на 5% то как увеличится Метрика 1?» или еще интереснее: «Если Метрика 6 увеличится на 5% то как увеличится Метрика 1?» В этом случае нам пригодится концепт Path model — это статистический инструмент, который позволяет схематически изобразить независимые и зависимые переменные. Если мы построили дерево метрик, значит, мы уже знаем наши зависимые и независимые переменные, их осталось только определить. Принято говорить, что зависимые переменные «объясняются» независимыми. Простой пример: Метрика Revenue (sic!) «объясняется», например, количеством заказов и средним чеком, а количество заказов — числом пользователей и конверсией. Revenue, количество заказов и конверсия — зависимые переменные. Число пользователей, средний чек — независимые: принять их за данность и не «объяснять» — это вопрос выбора исследователя и гранулярности модели. ✝️Зависимая переменная, не может быть исчерпывающе «объяснена». Сколько бы факторов вы не выбрали чтобы объяснить Revenue, ваши прогнозы всегда будут содержать ошибку — некоторый объем необъясненной дисперсии, в том числе из-за фактора случайности. Следовательно, чем длиннее цепочка зависимых переменных, тем выше пропорция необъясненной дисперсии ближе к концу цепочки => выше ошибка ваших прогнозов. Если вы строите комплесный продукт и пытаетесь понять, как на NSM отразится метрика, которая находится на несколько уровней ниже — какой бы высокой или низкой ни была эта величина в реальности, модель дерева метрик даст вам не больше, чем дала бы простая догадка. ✝️Даже если вы идеально определили каузальный порядок ваших метрик, дерево метрик подразумевает линейную зависимость переменных — многие процессы в продукте нелинейны. Каждый шаг цепочки содержит ошибку, чем дальше от NSM — тем выше эта ошибка. Rule of thumb — если хотите использовать дерево метрик, как предсказательную модель, то не уходите дальше, чем на 2-3 уровня вниз. Естественно, это очень ограничивает использование этой модели, как способа количественно оценить приоритеты продукта. Иллюстрации в следующем посте #product_management #it #метрики #metrics

  • Enshitification и пограничные пользователи продукта У BMW есть интересная технология лазерных фар – Laser Light. Идея лазерных источников света не нова, но из-за дороговизны, эта технология крайне редко добираются до пользователей. Энтузиасты были в восторге от этих фар: иметь в своей машине не простую фару, а уникальный оптический прибор с высокой эффективностью — это роскошь. Однако, год назад, BMW прекратили их производство. История с Laser Light — хорошая иллюстрация процесса «enshitifcation»: ухудшения продукта с ростом его популярности. Если у продукта есть пользователи, которые им пользуются, есть и все те, которым продукт безразличен. Третья категория пользователей, находится на пересечении первых двух — пограничные пользователи (marginal users). Они находятся на границе заинтересованности в продукте — это те, чье внимание вы едва-едва смогли удержать. Именно на конвертации пограничных пользователей в активных и строится стратегия роста очень многих продуктов: сперва вы делаете продукт для энтузиастов, и ваши пограничные пользователи не сильно от них отличаются, но спустя несколько итераций роста, вы уже делаете продукт для всех Если вы, как и я, интуитивно понимали это, но не могли это сформулировать, то посмотрите статью, про которую не говорил только ленивый: The Tyranny of the Marginal User Портрет пограничного пользователя: Назовём его (пограничного пользователя) Марл. … Как только Марл открывает ваше приложение, у вас есть примерно 1,3 секунды, чтобы привлечь его внимание ярким изображением или цепляющим заголовком, иначе он вернётся в TikTok и больше никогда не откроет ваше приложение. Марл совершенно нетерпим к сложности пользовательского интерфейса. Насколько можно судить, у него работает только один большой палец, и единственное, что он может делать, — это повторяющиеся, словно зомби, движения вверх. - - - - - - - Почти всё популярное потребительское ПО тяготеет к минимальному участию пользователя, бесконечно прокручиваемым лентам новостей и бесполезному контенту. Даже жемчужина интернета, сам Google Search, деградировал настолько, что стал непригоден для сложных запросов. Reddit и Craigslist остаются невероятно полезными и ценными именно потому, что они застыли во времени. Ни BMW, ни та фирма над продуктом которой вы сейчас работаете, не могут позволить себе выпускать один и тот же автомобиль или заморозить ту трушную версию SaaS, которую так полюбили первые пользователи: у бизнеса всегда существуют обязательства, как и страх стать второй Nokia. Более того, очень сложно рационализировать такой стазис и бизнесовая прагматичность всегда берет верх над идеализмом Пограничному пользователю не нужны лазерные фары, а вот мультимедия или автоматизация парковки — очень даже. Поэтому, средства от Laser Light будут перераспределены на более приоритные «фичи» В цифровых продуктах мы пытаемся распределить другой ресурс — внимание пользователя: …Вы могли бы подумать, чтобы сделать всё более удобным для Марла … Горстка пикселей, занимаемых вашей маленькой кнопкой, заменила пиксели, содержащие броский заголовок или милую картинку щенка. Марл устраивает истерику и переходит в TikTok, больше не возвращаясь в ваше приложение. Ваша фича снижает количество активных пользователей в день (DAU) в A/B-тесте. На заседании комитета по запуску фичи вы бормочете что-то об «участии пользователя», в то время как ваш VP смотрит на вас с жалостью и презрением. Ваша фича не релизится. Вы не получаете повышения. Ваша жена уходит от вас. Вероятно, к Марлу. На этом я остановлюсь и предложу прочитать статью самостоятельно — это отличное эссе, как по форме, так и по содержанию. #product_management #it #пользователи

  • Не люби α-values – обманут, не люби p-values – обманут Отвечаю на вопрос, который я задал в предыдущем посте: NHST (Null Hypothesis Significance Testing) – метод, который объединил две методологии, которые совершенно несовместимы, как философски, так и логически…

  • Не люби α-values – обманут, не люби p-values – обманут Отвечаю на вопрос, который я задал в предыдущем посте: NHST (Null Hypothesis Significance Testing) – метод, который объединил две методологии, которые совершенно несовместимы, как философски, так и логически Каждый раз, когда вы слышите про тестирование статистических гипотез, с большой вероятностью, вы слышите именно про NHST Интерпретация NHST: при t=2, α = 5, df=999; p-vale(0.04577)<α(0.05) => принимается H1 Практические предпосылки этого смешения более чем понятны: бизнес, как и любая экспериментально-практическая деятельность хочет получить простой ответ на сложный вопрос: что лучше – A или B? Кошки или собаки? Аянами Рэй или Аска? И NHST дает иллюзию ответа на этот вопрос: в качестве результата мы получаем бинарный ответ – «да» или «нет», а еще и p-value, как показатель статистической значимости. Попытка усидеть на двух стульях неизбежно влечет за собой противоречия: ✝️Первое противоречие – трактовка выводов: Метод Неймана-Пирсона – механическая процедура, которая порождает однозначный бинарный ответ, метод Фишера подразумевает непрерывную градацию статистической значимости. В нашем примере мы отклонили H0, приняв H1 с p-value = 0.04577 (p<α). И хотя мы в точности следовали процедуре, с точки зрения убедительности доказательств, нет никакой разницы между p=0.04577 или например p=0.06 – это значения одинаковых порядков, которые трактуются как одинаково слабые свидетельства против H0. Формальное соблюдение неравенства p<α в этом случае не играет роли: статистическая значимость – не бинарный вывод, это градиент убедительности. ✝️Второе противоречие – несовместность нулевых гипотез: Сравнение α и p-value – исключительно механическое правило принятия решения, сами значения друг с другом никак не связаны по смыслу. Мы называем α вероятностью ошибки первого рода только потому, что оно соответствует значениям реальных данных, которые находятся в двух или трех стандартных отклонениях от среднего – это все «самые»: самые низкие, самые высокие, самые умные или самые глупые. Мы предполагаем, что распределение альтернативной гипотезы может располагаться внахлест относительно распределения H0, поэтому мы рискуем 5%/ 1% ложноположительных выводов на большой дистанцией измерений. В свою очередь, p-value ничего не «знает» про α: p-value из мира, где нулевая гипотеза всегда верна и непогрешима ✝️Третье (хоть и не-противоречие) – завышенные ожидания: Тестируя статистически гипотезы сложно не испытывать соблазн увидеть в результатах больше, чем эти результаты могут сказать. Бизнес хочет знать: «верна ли выбранная гипотеза, действительно ли A лучше B?» И кажется, что ответ так близок! Ужасно сложное определение p-value про такие же или более экстремальные значения… схлопывается до «вероятность того, что нулевая гипотеза верна». И вот мы получили p=0.04577, значит ли это, что нулевая гипотеза верна с вероятностью 4%? Теорема Байеса говорит, что реальная, эмпирическая вероятность ошибки первого рода значительно больше – как минимум 20%! Если попробовать записать это формально, то: p-value = P(наблюдаемый эффект|H0 верна), вероятность того, что нулевая гипотеза верна – P(H0 верна|наблюдаемый эффект) – даже не вдумываясь в эту запись, несложно понять, что такое определение переворачивает направление условности Так как фриквентистская статистика не может привязать вероятности к гипотезам (распределениям), а только к случайным переменным, чтобы оценить вероятности того, насколько нулевая гипотеза может быть верна, мы вынуждены применить теорему Байеса. Авторы одной статьи рассчитали разные значения p-value и вероятности отклонить истинную нулевую гипотезу: При p=0.05 – 23% (но чаще ближе к 50%!!!) При p=0.01 – 7% (но чаще ближе к 15%!!) При p=0.001 ~ 1% Эта запись очень хорошо иллюстрирует тот самый «градиент убедительности» Тест не дает нам оценку "верности наших гипотез": мы оперируем лишь категориями правдоподобия и убедительности #статистика #ab_тесты #product_management #pvalue #гипотезы

  • видео или голосовое, без подписи

  • Не могу не поделиться своим самым любимым примером Фишеровского ризонинга: Есть два дельфина: Базз и Дорис, между ними находится стенка. Дорис видит лампочку, которую не видит Базз. Когда лампочка мигает, Базз должен нажать на правую кнопку, а когда горит постоянно – левую. После 16 опытов, Базз выбрал правильную кнопку 15 раз из 16. Значит ли это, что дельфины умеют общаться? Или Базз просто самый везучий дельфин в мире? Так как у этого опыта всего два исхода – "угадал" или "не угадал", можно смоделировать нулевую гипотезу (то, что Баззу просто повезло) простой серией бросков монетки: провести ~200 опытов по 16 бросков в каждом (после 126 кликов и у меня устал палец и только после этого я заметил, что количество опытов можно задать через отдельное поле 🤷‍♂️ ) В результате этих опытов мы получим распредление вероятностей, из которого следует то, что вероятность получить 15 (орлов) из 16 попыток примерно равна тысячной процента! Это и есть p-value: уровень удивительности доказательств против H0 (вероятность получить такие или более экстримальные значения, при условии, что нулевая гипотеза верна)

  • Самое явное приложения метода Неймана-Пирсона — это создания правила принятия решения: у нас есть два распределения некоторого белка, оба известны, среднее распределения у здоровых (H0) — 35, у больных (H1) — 50 Доверительный интервал H0 (1-alpha) = 35 ± 3.29 Доверительный интервал H1 (1-beta) = 50 ± 7.5 Области Alpha и Beta – слепые пятна: Есть здоровые с концентрацией белка >38.29 (это и есть alpha — предположим, что таких 5% в популяции) – мы их будем классифицировать как больных (FP, Type 1 error) Но есть больные с концентрацией белка <38.29 (это beta — в нашем случае, таких 20%) — мы их будем классифицировать как здоровых (FN, Type 2 error) Если не менять ничего другого, то изменения в alpha (наша линия cutoff) повлекут изменения в beta: например если мы считаем, что лучше признавать здоровых больными, мы увеличим alpha (тем самым, уменьшив beta), или наоборот Когда пациент покупает тест в аптеке, в зависимости от концентрации белка, тест покажет "Болен" или "Здоров". Проводя онлайн-тесты, мы используем этот метод иначе: нам известны параметры распредление H0, мы экспертно задаем cutoff (alpha) – с конкретным числовым выражением (например, процент конверсии sic!), но мы не знаем распределение H1: для этого нужно собрать достаточное количество наблюдений (достаточность которого определяется анализом мощности с выбранным MDE, alpha, beta). В этом случае, мы не оцениваем каждого пользователя по отдельности, как в примере выше: мы сравниваем то, насколько распределения различны между A и B. Если среднее значение выборочного распредления группы B больше нашего cutoff, мы принимаем H1, в противном случае – H0 и оставляем вариант A Но смысл очень похож для обоих приложений фреймворка: есть конкретное пороговое значение, которое устанавливает правило, стандарт для принятия решения

  • Что общего у теста на беременность и двигателя бесконечной невероятности Дугласа Адамса? Представьте, что мы провели A/B тест (n=1000, H0: µ1-µ2=0, H1: µ1-µ2≠0) и посчитали t-статистику: t = 2. ✝️Интерпретация Фишера: для t=2, df=999, p-valuе = 0.04577 => слабые доказательства простив H0 p-value здесь – выражение непрерывной статистической значимости: чем p-value меньше – тем экспериментальные данные «удивительнее». Как мы помним, в парадигме Фишера нулевая гипотеза – 100%-верная модель, а масштаб отличий от нее имеет разную градацию удивительности в соответствии с величиной этих различий (исходя из этого и происходит классическое определение: «вероятность получить такие же или более экстремальные значения, при условии, что нулевая гипотеза верна») Концептуально, проводя эксперимент, мы хотим получить абсурдно маленькую вероятность того, что наш результат объясняется нулевой моделью. Мне нравится думать про p-value как о двигателе бесконечной невероятности из «Автостопом по галактике»: в книге Дугласа Адамса, мгновенно оказаться на другом краю вселенной возможно, просто крайне маловероятно (удивительно) – именно эту вероятность и использовал двигатель Золотого Сердца Хотя, такой двигатель и остается уделом фантастики, статистика умеет находить абсурдно маленькие p-values – это задача воспроизводимости и грамотной постановки экспериментов В итоге, этот метод дает нам количественную оценку доказательств против H0, которую сам Фишер определял, как просто точку данных, которая не содержит информации о том насколько мы правы, и имеет смысл только как материал для мета-анализа подобных экспериментов ✝️Интерпретация Неймана-Пирсона: при t=2, α = 5, df=999; 2>1.962 (критическое значение для α=5) => принимается H1 Про фреймворк Неймана-Пирсона можно думать как про тест на беременность: есть значения hCG для беременных и не беременных: 1-α – это диапазон концентрации hCG у не беременных (доверительный интервал), а 1-ß – это диапазон концентрации hCG у беременных. Если концентрация hCG у пациентки попадает в интервал 1-α, она не беременна и наоборот. Попадание в области а и ß соответствует ошибкам первого (False-Positive) и второго рода (False-Negative) Тест помогает ответить на вопрос: «Учитывая концентрацию hCG у пациентки, беременна она (H1) или нет (H0)»? NB! проводя тест в продукте, мы не знаем какое распределение у H1, но в случае с тестом на беременность аналитическая работа уже проведена: мы доподлинно знаем распределения H0 и H1 и смотрим в какое попадает результат пациентки и это именно тот сценарий, для которого тест Неймана-Пирсона и был изначально разработан! Фактически – этот подход решает задачу бинарной классификации, где α и ß – являются константами помогающими контролировать ошибки первого и второго рода на большой дистанции экспериментов и не говорят о реальном количестве ошибочных выводов и не гарантируют истинность выбранной гипотезы – мы просто соглашаемся с правилом выбора. Without hoping to know whether each separate hypothesis is true or false, we may search for rules to govern our behavior with regard to them – Neyman and Pearson Я надеюсь, что я смог донести фундаментальные различия этих двух подходов, однако, нечто общее у теста на беременность и двигателя бесконечной невероятности, к сожалению, все же нашлось, но об этом я расскажу в следующем посте #статистика #ab_тесты #product_management #pvalue #гипотезы

Depeche Prod — tgindex