15 нейросетей против букмекера: как ML считает голы

15 нейросетей против букмекера: как ML считает голы

15 нейросетей против букмекера: как ML считает голы

Я вчера разбирал матч Irao — Gardabani и буквально офигел: модель выдала П1 с вероятностью 100%. Звучит как развод? Нет, как пример того, как ИИ видит там, где человек покачивает головой. Давайте разберём, что происходит внутри black box'а.

Что ест модель на завтрак

Прежде чем предсказать исход, ML скормит десятки признаков. Топ-3, без которых никакая нейросеть не выживет:

  • xG (ожидаемые голы) — не просто «сколько забили», а качество моментов. Команда с xG 2.1, но 0 голов — верный знак, что впереди перелом.
  • Glicko-2 — эло-подобная система, учитывающая не только рейтинг, но и его надёжность (rating deviation). Идеально для низших лиг, где данных мало.
  • Форма (последние 5-10 матчей) — но не просто ВВНВН, а взвешенная по силе соперника. Победа над аутсайдером = 1 очко, над топ-3 = 3.

Какие алгоритмы крутятся в движке

На практике я вижу три кита:

  1. XGBoost / LightGBM / CatBoost — градиентный бустинг над деревьями. CatBoost особенно хорош с категориальными признаками (имена стадионов, судьи, погода).
  2. Random Forest — ансамбль из сотен деревьев. Стабильнее, но чуть медленнее. Отлично ловит нелинейки: «если команда пропустит первой, вероятность отыгрыша растёт не линейно».
  3. Нейросети (LSTM / Transformer) — для временных рядов и последовательностей. Вспоминают, как команда реагировала на ранние голы в прошлом сезоне.

Ансамбль — когда одна модель врут

Ни один алгоритм не идеален. Поэтому финальный прогноз — это взвешенный микс. Например, для Urartu — Syunik (П1 = 41%):

  • XGBoost дал 39%
  • Логистическая регрессия — 43%
  • Нейросеть на xG-сериях — 40%

Итоговый ансамбль: 41%. Разброс маленький — модель уверена. А вот в Tobol — Partizan (П1 = 35%) разброс мог быть 28-47% — значит, сигнал слабый, и беттеру стоит насторожиться.

Где прячется валуй

Валуй — это когда ML-вероятность выше implied-вероятности букмекера. Возьмём Independiente Riva. Res. — Ferro 2: модель даёт 43% на ничью, кэф 3.30. Имplied от кэфа = 30.3%. Перевес = 12.9%. Это не просто ставка, это математическое преимущество. Но!

Низшие лиги (Reserve League, 1. Division) — зона высокого риска. Меньше данных, больше случайности, быстрее меняются составы. Модель может дать 38% на П1 у Central Córdoba Res. — Independiente Res., но реальный разброс результатов там огромён.

Показатели точности: не верь цифрам на веру

Буквально вчера я смотрел на метрики наших моделей:

  • Brier score (среднеквадратичная ошибка вероятностей) — 0.18-0.22 для топ-лиг, 0.25-0.32 для низших. Ниже — лучше.
  • Log-loss — штрафует за самоуверенные ошибки. Модель, давшая 100% на проигравшего, получает адский штраф.
  • ROI по валуйным ставкам — на дистанции 500+ событий должен быть положительным. Если нет — модель переобучена или данные устарели.

Итог

ИИ негадает — он оценивает вероятности через призму данных. Grotta — Njardvik (П1 = 50%) — это не «монетка», а результат, где все ключевые признаки сошлись. А Shkend

#модель #топ #просто #команда #данных

← Все новости