От xG до Glicko-2: как ML-модели считают голы и где букмекеры ошибаются

2370₽790₽ за 90 дней
АКЦИЯ ОГРАНИЧЕНА ВО ВРЕМЕНИ
00дней
:
00часов
:
00минут
:
00секунд
Купить за 790₽
От xG до Glicko-2: как ML-модели считают голы и где букмекеры ошибаются

От xG до Glicko-2: как ML-модели считают голы и где букмекеры ошибаются

Я вчера разбирал матч «Maccabi Netanya — Hapoel Haifa» и наткнулся на цифру, от которой у букмекера, наверное, потекли усы: модель предсказала тотал меньше 4.5 с вероятностью 87%. Это не магия — это машинное обучение. Давайте разберём, как именно ИИ «видит» футбол и почему его прогнозы иногда бьют точно в кассу.

Что ест модель? Feature engineering — это всё

Прежде чем запустить алгоритм, мы готовим данные. И вот тут начинается магия. Основных фич у нас несколько:

  • xG (ожидаемые голы) — вероятностная оценка, а не приговор. Модель считает, что если команда создаёт моменты с суммарным xG 1.8 за матч, то в среднем она должна забивать почти два гола. Но реальный исход зависит от реализации моментов, решений ВАР и человеческого фактора.
  • Форма команд — последние 5-10 матчей, вес которых снижается по мере удаления от текущей даты.
  • Glicko-2 — рейтинговая система, которая учитывает не только силу соперника, но и волатильность рейтинга. Команда с высоким Glicko-2 и низким deviation — стабильный фаворит.
  • Домашнее преимущество — статистически даёт около 0.3-0.5 голов в среднем по топ-лигам.

Какие модели мы используем

Наша линия строится на ансамблевых методах. Почему? Потому что одна модель может ошибаться, а коллектив — нет. Вот наш арсенал:

Random Forest — отлично работает с нелинейными зависимостями. Например, он заметит, что при разнице Glicko-2 более 150 очков вероятность победы фаворита растёт нелинейно.

XGBoost и LightGBM — градиентный бустинг, который последовательно исправляет ошибки предыдущих деревьев. LightGBM быстрее, XGBoost точнее на небольших выборках.

CatBoost —our favourite для работы с категориальными признаками (названия команд, лиги, типы матчей). Он меньше склонен к переобучению.

Нейросети (MLP, LSTM) — для анализа временных рядов. LSTM хорошо улавливает серий: «команда не пропускает 4 матча подряд» или «в 7 из 8 последних очных встреч тотал меньше 2.5».

Ансамбль и взвешенное голосование

Каждая модель выдаёт свою вероятность. Мы берём взвешенное среднее, где вес зависит от исторической точности модели на похожих матчах. Например, на матчах израильской Ligat Ha'al лучше всего исторически работал CatBoost, поэтому его голос весит больше.

В матче Foolad FC — Fajr Sepasi ансамбль выдал 93% вероятности тотала меньше 4.5. Это высокий кэф для букмекера, потому что модель видит слабую реализацию моментов у обеих команд и низкие средние xG в последних встречах.

Показатели точности: где мы реально хороши

#модель #меньше #команда #команд #glicko

← Все новости