Я вчера разбирал матч Dalian Zhixing vs Beijing Guoan — и мой алгоритм выдал 90% на победу гостей. Букмекер? Смешно. Давайте разберём, что на самом деле происходит под капотом.
Какие модели мы используем
В основе — не одна, а целый Zoo моделей. Random Forest (случайный лес) отлично ловит нелинейные зависимости: например, как форма команды из 5 последних матчей влияет на тотал. XGBoost и LightGBM — градиентный бустинг — наши рабочие лошадки для быстрого обучения на тысячах исторических встреч. CatBoost творит чудеса с категориальными признаками (лига, домашнее/гостевое поле). А нейросети (LSTM, MLP) — это уже про последовательности: они «помнят», как команда менялась на протяжении сезона.
Feature engineering — сердце системы
Модель не умеет «чувствовать» футбол. Ей дают цифры. Ключевой фича — xG (ожидаемые голы). Если команда создаёт моменты на 2.1 xG за игру, но не забивает — это сигнал к коррекции. Форма — не просто «3 победы подряд», а взвешенная средняя по последним 5-10 матчам с убывающим весом. И Glicko-2 — рейтинговая система, которая учитывает не только силу соперника, но и волатильность: команда с низким Glicko, но стабильными результатами, часто недооценена.
Ансамбль решает
Одна модель — это риск. Поэтому мы используем стэкинг: прогнозы Random Forest, XGBoost, LightGBM, CatBoost и нейросети сводятся в итоговую вероятность через взвешенную среднюю. Например, в матче Terengganu vs Selangor лес дал 92% на П1, но нейросеть «сбросила» до 78%, увидев аномалию в xG гостей. Ансамбль выдал итоговый прогноз на ТМ 2.5 + ИТБ0.5 Селангор — и это валуй.
Насколько мы точны?
Наша Brier-оценка (мера точности вероятностных прогнозов) — около 0.041 на топ-лигах. Это значит: среднее отклонение предсказанной вероятности от реального исхода — 6-7%. Для сравнения: букмекерская маржа «съедает» 8-12%. В матче Suwon FMC W vs Seoul W мы нашли VALUE BET на ничью: вероятность 28%, кэф 7.00 — перевес 13.8%. Да, риск огромный, но математика на нашей стороне.
Честно о рисках
ML не гарантирует выигрыш. В Olympic El Qanah vs El Gouna модель показала 18% на П1 — и это не ошибка: данные говорили, что фаворит в кризисе. Но 18% — это не 0%, и один случайный гол ломает всё. Банкролл-менеджмент важнее любой модели.
Вывод
ИИ не угадывает — он считает. xG, форма, Glicko-2, ансамбль моделей — вот ваш инструмент. Используйте его, но помните: даже 90% вероятности — это не страховка. Удачи за столом!
#форма #команда #модель #glicko #ансамбль