tgindex
Fit Predict

Канал о применении методов Data Science в спорте Блог на спортсе: sports.ru/tribuna/blogs/fitpredict/

Последний пост
8 янв.
Последнее чтение
15:01
Постов за неделю
0
Всего постов
16
Тип
открытый
Язык
русский
Категория
Спорт
В каталоге с
16 авг.
Подписчики
416
мало замеров
Замеров пока мало
Сутки
 
Неделя
 
Месяц
 
Просмотров на пост
1 376
16 постов
Вовлечённость
330,8%
к подписчикам
Постов в день
0,0
всего 16
Упоминаний
1
каналов
Охват размещения
оценка
1/24сутки в ленте
1/48двое суток
1/72трое суток

Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.

Посты

  • Прилетела критика от иксжи-лаборанта. Самое смешное в ней, что ни я, ни Рип ничего про лонгболы не писали. Рип пишет: "It seems, however, that chance does dominate the game and probably most similar ball games." Моя фраза: "что не нужно делать много передач, чтобы забить. Сам метод достаточно топорный, но вывод в контексте 1968 года выглядит правдоподобно." Вывод о том, что нужно играть лонгболами, — это фантазии иксжи-лаборанта и, заодно, Грехама, раз уж он не спорит с Роджерсом по этому поводу. Почему вывод о том, что не нужно делать много передач, чтобы атаковать эффективно, кажется мне правдоподобным в контексте того времени. Во-первых, атака через малое количество передач не всегда означает лонгболы. Вообще, как можно атаковать? 1) Разыгрывать коротко 2) Лонгбол 3) Отобрать мяч у соперника. Нам особенно интересны случаи отбора вблизи чужих ворот 4) Условно. Провоцировать стандарты. Условно потому, что стандарты вырастают из предыдущих пунктов. Именно здесь проходит разница между определениями владения и подвладения. Суть фразы "не нужно делать много передач, чтобы атаковать" довольно хорошо ложится на последние три пункта. Про эффективность подобного метода или скорее про не эффективность метода разыгрывать коротко. Исследование было сделано на данных 1952-1967 годов. Какой футбол был в то время? 1) Газон. Финал ЧМ-1966, состояние поля не идеальное, видны кочки. Какие были огороды в рядовых матчах даже представить боюсь. Видимо, нужно при таких условиях всегда разыгрывать коротко от вратаря 2) Мяч и экипировка. Даже в вышеназванной нарезке немного режет глаз, что мяч не прилипает к газону, слегка скачет. Модель бутс от WC-1966 выглядит вполне себе достойно. Но эта линейка лаптей прям намекает на тики-таку. 3) Технический уровень футболистов, самое главное. Да, в этот период футболисты уже были полноценными профессионалами, а не работягами с завода. Но их путь в профессиональный футбол был даже близко не похож на современные детские футбольные академии. Просто посмотрите, как вратарь вводит мяч в игру рукой. Да, что говорить про 50/60-е годы, если в десятых нашего века, пусть и в РПЛ было такое. Но, возможно, я не прав и единственная причина, почему в то время не играли в тики-таки состоит в том, Гвардиола родился только в 1971 году.

  • Спрашивают про книги Не то что бы читал много книг про спорт, но в моменте нравились: 1) Купер, Шимански. Футболономика. Сейчас книга может показаться протухшей 2) Дэвид Эпштейн. Спортивный ген. Автор пытается ответить на вопрос: спортсменами рождаются или становятся 3) Майкл Льюис. Moneyball. Тут вроде все понятно 4) Джонатан Уилсон. Inverting the Pyramid. Правда, застрял на середине, надо добить наконец 5) Карло Анчелотти. Автобиография. Но на четверочку. Вообще говоря, не совсем автобиография, а скорее изложение философии Анчелотти. Тихое лидерство. Про умение работать со звездами. Если попадалось что-то получше, пожалуйста, поделитесь. А так, если хочется разобраться в спортивной аналитике, то уж лучше сами методы DA/ML учить, а потом уже думать, как их применять в спорте. Например, лекции Сергея Николенко послушать. По мне, гораздо полезнее потратить пару выходных и понять как работают деревья решений и линейная регрессия, чем прочитать очередную тысячу постов про xG, PPDA, регрессию к среднему и прочую приблуду. Но это уже совсем субъективное мнение.

  • По мне, основная проблема книги — это год издания. В вакууме она может быть интересной и даже полезной. Прорывной была «Футболономика». «Игра с числами» и «Футболоматика», вышедшие позже, были уже так себе. Но читать в третьей–четвёртой книге подряд истории про исследования пенальти, преимущество домашнего поля, попытки обыграть букмекеров и то, что голы в футболе распределены по Пуассону, уже надоедает.

  • Что понравилось 1) PostShot-xG с привлечением видеоаналитика, который размечал важные признаки игры вратарей. Нравятся истории, когда футбольные люди и дата чуваки не срутся, а взаимодействуют 2) Идея, что при оценке игры защитника нужно обращать на зону из которой пришла атака/удар. Не самый очевидный способ (по крайней мере для меня) оцифровать "отсутствие" информации по действию игрока. В этой части, как раз, приводится пример, что был защитник, у которого было много блоков и перехватов, но из зоны которого много ударов прилетало. 3) В целом, Грехэм будто бы отвечает на вопрос из заголовка. Суть не в том, что у Ливерпуля есть какие-то гениальные дата-аналитики, которые подсказали купить Салаха, а в том, что у клуба сформировалась культура, при которой руководство на практике осознало: важна каждая мелочь. И что мнение каждого сотрудника имеет значение — а не как у Якина с Журавелем. Ведь истории про тренеров по аутам появляются не просто так. В противовес этому — интервью Роналду о том, что тренировочная база МЮ устарела, и байка про дата-отдел Юнайтед без данных.

  • How to Win the Premier League Добрался до книжки Грехема. Многие (а может и все) автобиографии имеют понятный изъян. Автор пытается выставить себя в лучшем свете. Вряд ли всегда специально, просто со своей колокольни виднее. Но в этой части Грехэм выглядит прям глупо. Да еще и пытаясь такими выставить Роджерса и Рипа за компанию (который уже умереть успел). После этого эпизода читал уже по диагонали. Речь идет о старом, возможно, самом первом исследовании в футболе. Рип посчитал зависимость числа передач во владении с вероятностью гола и пришел к выводу, что не нужно делать много передач, чтобы забить. Сам метод достаточно топорный, но вывод в контексте 1968 года выглядит правдоподобно. Грехэм же называет метод неплохим, но вывод неправильным. Бред полнейший. Как это модель может быть хорошей, если ее вывод (применение) плохой? На самом деле здесь мы имеем классическую ошибку data shift. Входные данные настолько изменились, что вывод меняется на противоположный. Противоречия нет. Пример попроще: представьте, что вы обучаете отдельные модели xG на данных: 1) АПЛ 2) Кожанный мяч 3) НХЛ Вы же не станете говорить, что выводы по АПЛ корректные, а по хоккею нет.

  • Ковырял трекинг-данные одного поставщика. В одном из эпизодов мяч катился пару секунд, но скорость оставалась равномерной. Это смутило: мяч ведь должен был замедляться. Пошёл играться с ChatGPT. Действительно, мяч достаточно быстро теряет скорость. Потом захотелось добавить погодные условия. Мяч по мокрой траве катится быстрее, зато во влажном воздухе летит медленнее. Еще во время отскока от газона скорость резко падает, и часть энергии теряется. Тут внезапно вспомнил речь физрука о том, что волейбольный мяч нужно так накачивать, чтобы, падая с высоты двух метров, он отскакивал на метр. Оказалось, есть целые статьи о том, как правильно измерять отскок мяча. Он должен быть 1,35 м после падения на стальную плиту с двух метров. Правда, зачем нам все эти статьи, когда есть эксперты из Пакистана. К слову, такое моделирование помогает чуть лучше понять игру. На первых итерациях казалось, что мяч слишком быстро перестает прыгать, но на практике даже после длинных выносов он уже после двух отскоков почти не подскакивает. Код — в комментариях.

  • Небольшие пояснения: 1) вопросы можно задавать через телеграм-бот @aistats_bot или почту gleb.k@aistats.pro 2) Собеседования на DS-позиции раньше 11 августа не начнутся. Если есть желание, то есть время, чтобы почистить пет-проекты. В первую очередь касается кандидатов без опыта.

  • Если что, дата сайентистов буду я собеседовать😊 Отдел Data Science включает в себя R&D, что, наверное, и так очевидно. Воспроизвести xG, xP и прочие PitchControl несложно, особенно если формат данных удобный. А вот придумать новую метрику или значительно улучшить условный EPV — уже посложнее. При этом важно понимать, что ресёрч не заканчивается написанием прототипа — модель нужно довести до продакшен-состояния. По сути, необходимо уметь переводить футбольные бизнес-требования в модель или метрику. Отсюда идеальный кандидат выглядит так: - опыт с табличными ML-моделями; - чистый код на Python; - знание теории вероятностей и математической статистики; - опыт с deep learning; - интерес к футболу; - любовь к написанию тестов. Если чего-то из этого не хватает — не беда. Если вы крутой ресёрчер в jupyter notebook — мы вам рады. Если с креативом не сложилось, но вы умеете надёжно писать полезную рутину, которая, например, автоматически исправляет ошибки в сырых данных — мы тоже вам рады. Отбор будет состоять из трех этапов: 1. Отсев по резюме. Если есть github - пожалуйста, прикрепите. 2. Собеседование примерно на час-полтора. Поговорим о вашем предыдущем опыте. Также будет задача на подобие ML System Design. Никаких leetcode. 3. Знакомство с командой.

  • ⚽️ Новая возможность работы в футболе - Computer Vision-стартап AIstats расширяет свою команду. AIstats — стартап, который недавно привлёк $1.5M и уже сотрудничает с такими клубами как “Ньюкасл Юнайтед”, “Брентфорд”, “Комо” и “Ди-Си Юнайтед”. У любителей футбола из IT есть шанс присоединиться к команде, которая меняет подход к анализу игры. AIstats обрабатывает видеотрансляции матчей из 150+ футбольных лиг и воссоздаёт полную 3D-модель игры, в которой трекаются координаты 20 ключевых точек на теле каждого игрока. Данные фиксируются с частотой 25 раз в секунду — всё это создаёт фундамент для более глубокой, недоступной ранее оценки действий на поле. Одно из главных преимуществ подхода AIstats — высокая детализация ивентов. К примеру, для ивента отбор вместо примитивных параметров вроде успешности AIstats предоставляет десятки взглядов на это действие: по части тела (левая/правая нога и др.), типу отбора (подкат, корпусом, стоя, со спины) и по инициатору (атака, защита, обе стороны) и так далее. Кроме того, трёхмерный анализ позволяет выявлять уникальные события — такие как pitch scanning, 1-on-1 defending, push-on и другие — и давать более полную картину по важным для скаутинга (но плохо обсчитываемым ранее) компонентам: первое касание и игра под давлением. Но наиболее инновационной разработкой AIstats является AI Scout, публичный релиз которого запланирован на Q1 2026 года. В этом видео компания показала, как они предлагают оптимизировать процесс анализа игроков и данных за счет применения ChatGPT-формата. Команда AIstats уже насчитывает 25+ человек и в связи со скорым релизом активно ищет усиление среди футбольных энтузиастов по всем направлениям: - Команда разработчиков (Data Scientists, CV/ML Engineers, Backend (Node.JS), Backend (Python), Data Engineers, Frontend (Vue.JS), DevOps) - Продуктовая команда (Product/Project Managers, Data Analysts) - А также специалистов поддержки и разметчиков данных AIstats предлагает полностью удаленную работу и рассматривает кандидатов с любым уровнем знаний (от Junior до C-level). 📩 Оставляйте свои заявки через телеграм-бот @aistats_bot или почту gleb.k@aistats.pro и станьте частью AIstats!

  • Trajectory Imputation in Multi-Agent Sports with Derivative-Accumulating Self-Ensemble Был на ECML и позитивный момент. На ревью попалась действительно хорошая статья. Оценил в +2 при шкале [-3, +3], правда, организаторы дали три дня на оценку, поэтому пришлось поставить низкий уровень экспертизы. В статье восстанавливаются траектории игроков за кадром для баскетбола, футбола и американского футбола. Решение вряд ли претендует на SOTA. Сам я так неплохо глаза выпучил, когда прочитал, что кубический сплайн перебил решение DeepMind. Но авторы признались, что у них просто данных мало было. Код выложен, собственно этим статья и понравилась. Если нужно будет относительно быстро решать похожую задачу, то способы уже есть. Статья Код Ссылка на пост

  • Крайность вторая — детективная. Понятно, что любой отзыв — это в некоторой степени вкусовщина. Ну не понравилась статья — и всё тут. Но в сумме я начал замечать определённые паттерны. Доказать их сложно — процесс ревью анонимный — но, честно говоря, режут глаз. 1) К статье по рейтингам один из рецензентов порекомендовал мне почитать статейки из Springer Machine Learning Journal Soccer Prediction Challenge. На мой взгляд, довольно паршивые. Один из гостевых редакторов этого выпуска — Jesse Davis, руководитель лабы DTAI Sports Analytics Lab at KU Leuven. 2) К статье про EPV один из рецензентов толсто намекнул, что я плагиатчик, который не процитировал "ключевые" статьи: a) Actions speak louder than goals: valuing player actions in soccer — авторы из всё той же DTAI, Jesse Davis среди соавторов. b) un-xPass: Measuring Soccer Player's Creativity — снова DTAI и снова Jesse Davis. Обе статьи, по моему мнению, содержат грубейшие методологические ошибки и вообще ничего нового не привносят. 3) По третьей статье я снова получаю настоятельную рекомендацию к un-xPass. Дополнительно упоминается отвратительная статья Towards maximizing expected possession outcome in soccer, где вторым автором значится бывший член DTAI — Jan Van Haaren. 4) Воркшоп, на который меня послали организаторы — тоже проводится людьми из DTAI. 5) Пока гуглил почты организаторов, внезапно обнаружил, что самая цитируемая статья вышеупомянутой Inês Dutra была написана в соавторстве с Jesse Davis. Возможно, я параноик. Но вам не кажется, что чего-то многовато этого чувака в одном и том же месте, примерно в одно и то же время? А если я всё-таки не параноик, то вырисовывается картина откровенно пиздецовая: когда представители одной лабы систематически пушат авторов цитировать свои убогие статьи, только потому что ты их не процитировал. Зато если процитируешь — добро пожаловать на воркшоп. А мы за твой счет цитируемость накрутим. Если что, документ содержит негативные обзоры на вышеприведенные статьи.

  • Вряд ли кто-то захочет читать 40-страничный текст, поэтому изложу суть через призму двух крайностей. Крайность первая — относительно объективная. Рецензентам нужно было ответить на несколько вопросов. Один из них — прикрепил ли автор данные и код. Варианты ответов: 1) Нет, и статья так плохо написана, что непонятно, как вообще всё это воспроизвести. 2) Код и данные не прикреплены, но по уважительным причинам. 3) Код и данные прикреплены. На практике в форме можно было прикрепить ZIP-архив. И если он не прикреплён — это сразу видно. К статье с рейтингами я архив прикрепил, причём папка data лежала прямо в корне. Два из четырёх рецензентов отмечают, что я не прикрепил код и данные. Когда одна из организаторов, Inês Dutra, всё-таки ответила, она написала что-то в духе: мол, peer-review процесс, конечно, скомпрометирован, но альтернатив нет. Да и вообще — наука уже давно погрязла в дерьме и прочие бла-бла-бла про академический мир. Я ей написал, что изначально был пессимистично настроен по поводу своей жалобы. То, что у вас творится какая-то дичь — это и так очевидно. Но вот признать это официально — значит запустить хоть какие-то процессы. Если мы соглашаемся, что, как минимум, два рецензента были предвзяты, то их нужно кем-то заменить? А кем? Людей надо искать. Или, не дай бог, самой отзывы писать. А это лень. Так что вы — такая же часть этого академического мира, как и все остальные. Я ведь дал вам шанс этот мир хоть немного улучшить — но вы предпочли ничего не делать.

  • Пару недель назад в публичной форме выразил презрение к вялым, однако социально активным членам сообщества футбольных дата-сайентистов. История такая: отправил три статьи на конференцию ECML. Две — это отполированные версии моих препринтов: arxiv.org/abs/2310.11459 arxiv.org/abs/2406.00814 В итоге получил три отказа. Третья статья недоделана, и текст там так себе, поэтому отказ по ней я ожидал. А вот отзывы на первые две статьи были совсем неадекватными. В итоге написал письмо-апелляцию на 40 страниц организаторам конфы — прикреплено к посту. Ответили шаблонной дичью, мол, всё понимаем, можете на наш воркшоп податься. В ответ я назвал их не настоящими исследователями, а приспособленцами, которые защищают таких же коллег-паразитов. (на слове "приспособленец" я немного завис, так как из головы английский аналог не подобрал. Переводчик предложил opportunist, что, по мне, не совсем корректно.) После этого мне один из организаторов таки ответил, однако не предложил никакого конкретного решения. Однако я вижу проблему не в самой конфе, а в сообществе "публичных" футбольных дата-сайентистов в целом. Чуть подробнее — в постах ниже. Вообще, это уже второй раз, когда мне отказывают по неадекватным причинам. Два года назад отправлял пропозал (идея исследования на 500 слов) в StatsBomb Conference с рейтингами единоборств — причём я там предлагал посчитать не только верховые, но и дриблинг с отборами. Не взяли, даже забыли отказ прислать. Через год вижу пост от этих кретинов, что они, мол, Glicko на верховых единоборствах посчитали. Написал им на почту — мол, прокомментируете? Ответил Chief Marketing Officer (какой важный курица), что мы эти рейтинги внутри компании уже года три шатали. Я ему в ответ: ты что, меня за дебила держишь? Вы вертикальную координату в xG добавите — и потом пару лет этим хвастаетесь. Короче, написал тогда пост в линкедине, где, обыграв их слоган Data Champions, назвал их Data Clowns. Реакции от представителей SB не последовало. Однако, если верить профилю в линкедине, тогдашний Head of Data Science спустя две недели после моего поста работать там перестал. На сам StatsBomb я тогда полноценно злился/обижался дня два. Всё это в некотором роде перешло в насмешку. Мол, ну в чём проблема была — принять на конфу и заимплементить? Тогда мне казалось, что просто эти идиоты пытаются строить из себя каких-то открывателей-ресерчеров. Сейчас думаю, что это была инициатива конкретного человека, от которого, скорее всего, требовали придумать что-то новое, а не всем отделом xG по пять лет улучшать. Вот он и решил забраковать что-то стоящее и записать на себя чужие идеи. В общем, подумал тогда: да и хуй с этой конфой. Всё равно там ничего реально стоящего никогда не публиковалось. А то, что моя идея в итоге пошла в прод, как раз и говорит о том, что она чего-то да стоит. Сильно сомневаюсь, что опубликованные статейки на этой конфе вообще где-то использовались в реальной индустрии. Думаю, что эти "исследования" и самим авторам не особо нужны: "учёным" — чтобы KPI закрыть, остальным — себя попиарить, сфоткаться на Уэмбли в окружении таких же дебилов. Цирк уродцев. Сделал тогда вывод, что надо подаваться на нормальные конференции. И вроде бы Applied Track ECML казался приличным выбором.

  • Как посчитать вероятности того, какие места займут команды, если известно математическое ожидание голов для каждой из них в каждом матче? Голы в футболе распределены примерно по Пуассону, с небольшими отклонениями, особенно в районе нуля (можно ознакомиться с моделью Dixon-Coles). Чтобы посчитать вероятности каждой возможной разницы в счёте — 0, 1, 2, 3 и так далее — нужно "вычесть" два пуассоновских распределения. В результате получится распределение Скеллама. Оно как раз и описывает разницу голов и позволяет определить вероятность победы, ничьей или поражения: отрицательная разница — победа, ноль — ничья, положительная — поражение. Зная вероятности исходов всех матчей, остаётся запустить Монте-Карло симуляцию турнира, чтобы получить распределение мест команд. Ну и, конечно, — ода ChatGPT, который особенно хорош, когда ты знаешь, что должно получиться. Всего за пару вопросов он сгенерировал код, который можно найти в комментариях.

  • без подписи

  • Задача на статистическую интуицию Пример — игрушечный, и понятно, что на практике такое невозможно. Нужно определить, у какого игрока удар сильнее. Первый игрок сделал 100 ударов "на технику" со скоростью 100 км/ч и 10 ударов "на силу" со скоростью 150 км/ч. Второй игрок тоже выполнил 100 ударов "на технику" со скоростью 100 км/ч, но дополнительно сделал 50 ударов "на силу" со скоростью 140 км/ч. Проблема как раз в этих ударах "на технику". Если бы каждый раз футболисты били изо всех сил, можно было бы просто посчитать среднюю скорость и сравнить. Но в данном случае нам приходится сравнивать максимумы. По сути, в реальности первый игрок бьёт сильнее. Однако это — идеализированная ситуация, где мы знаем истинные скорости. На практике скорости почти наверняка будут измерены с ошибкой. Давайте сымитируем эту ошибку: добавим нормально распределённый шум к обоим векторам, с таким расчётом, чтобы средняя по модулю ошибка составляла 10. Формально, добавим шум с дисперсией 10/0.798. Это означает, что мы переходим от истинных значений v к значениям v±10 в среднем по модулю. Если прогнать все это безобразие через кучу итераций Монте-Карло и на каждой итерации определять, у какого игрока наблюдается большее максимальное значение, то в какой доле экспериментов окажется, что максимальная скорость первого игрока выше, чем у второго?