15 нейросетей против букмекера: как ML реально считает футбольные матчи

15 нейросетей против букмекера: как ML реально считает футбольные матчи

15 нейросетей против букмекера: как ML реально считает футбольные матчи

Я вчера разбирал матч SC Villa — Express, где модель выдавала П1 с вероятностью 90%. Букмекер? Тот же кэф. Кто из нас прав? Давайте копнём глубже и посмотрим, что скрывается за этими цифрами.

Какие модели мы используем

В арсенале Zeta AI — не одна, а целая пачка алгоритмов. Random Forest (случайный лес) — это как спросить 100 тренеров и взять медиану. Каждая «дерево» смотрит на свои признаки и голосует. XGBoost и LightGBM — градиентный бустинг, который последовательно исправляет ошибки предыдущих моделей. CatBoost — особенно хорош с категориальными данными: названия лиг, типы турниров, домашнее/гостевое поле.

Но это только классика. Нейросети (в том числе LSTM и графовые сети) захватывают последовательности — как команда играла последние 10 матчей, как менялась форма. Именно они уловили, что Tzeirey Tamra — Hapoel Umm al-Fahm с вероятностью П1 88% — это не случайность, а устойчивая закономерность.

Feature engineering: что модель «видит»

Самое важное — не модель, а признаки, которые вы в неё скармливаете. Вот наш основной набор:

  • xG (ожидаемые голы) — не просто «сколько забили», а насколько качественно создавались моменты. Матч Hapoel Ramat HaSharon — Hapoel Mahane Yehuda показал П1=93% именно потому, что xG хозяев стабильно выше 1.8 за игру.
  • Форма — последние 5-10 матчей с весовым коэффициентом: свежая игра важнее полугодовой давности.
  • Glicko-2 — рейтинговая система, которая учитывает не только победы, но и силу соперника. В отличие от ELO, у Glicko-2 есть rating deviation (RDP) — мераности. У только что сыгравших команд RDP падает, и прогноз становится надёжнее.

Ансамбли: сила в множестве

Ни одна модель не идеальна. Поэтому мы используем ансамблевые методы: Stacking, где мета-модель учится комбинировать прогнозы базовых алгоритмов, и Blending. Результат? Стабильность. Посмотрите на Baník Prievidza — Baník Lehota p.Vtáčnikom: Cup, П1=95%, тотал больше 1.5 с вероятностью 95%. Это не удача — это консенсус пяти разных моделей.

Точность: где мы сейчас

Наши ансамбли показывают ~62-65% точности на рынке «победа» в топ-лигах и ~58-60% на тоталы. Звучит не впечатляюще? А между тем букмекерская маржа — 5-10%. Превысил её — и ты в плюсе на дистанции. Валуй рождается именно там.

Честно о границах

xG — это вероятностная оценка, а не приговор. Реальный исход зависит от реализации моментов (кто-то бьёт по дереву, кто-то — по воротам), решений ВАР, травм за 20 минут до свистка и банального человеческого фактора. Модель не предсказывает будущее — она оценивает вероятности на основе прошлого. И это главное, что нужно понимать.

Что с этим делать?

Если вы новичок — начните с тоталов и форов: там меньше шума от случайностей. Используйте ML-прогнозы как один из источников, а не как истину в последней инстанции. И никогда не ставьте больше 2-3% банкролла на один матч — даже если модель показывает 95%.

Помните: в беттинге побеждает не тот, кто угадывает каждый исход, а тот, кто находит валуй там, где букмекер ошибся.

#модель #матч #вероятностью #тот #только

← Все новости