15 нейросетей против букмекера: как ML считает голы и обманывает кэфы

2370₽790₽ за 90 дней
АКЦИЯ ОГРАНИЧЕНА ВО ВРЕМЕНИ
00дней
:
00часов
:
00минут
:
00секунд
Купить за 790₽
15 нейросетей против букмекера: как ML считает голы и обманывает кэфы

15 нейросетей против букмекера: как ML считает голы и обманывает кэфы

Я вчера три часа разбирал матч Flora II — Nõmme Kalju II, и знаете, что удивило? Модель дала 62% на победу хозяев, а букмекер предлагал кэф, который явно завышен. Вот тут-то и рождается валуй — и именно об этом мы поговорим.

С чего всё начинается: feature engineering

Прежде чем любая нейросеть выдаст прогноз, ей нужно «скармлиать» данные. Я часто говорю новичкам: мусор на входе — мусор на выходе. Что мы скармливаем моделям?

  • xG (ожидаемые голы) — не просто голы, а качество моментов. Команда забила 2, но xG был 0.4 — это красный флаг.
  • Glicko-2 — рейтинговая система, которая учитывает не только победы, но и силу соперника. Простой Elo тут мимо кассы.
  • Форма последних 5-10 матчей — но не просто W-D-L, а взвешенная по времени: последние игры весят дороже.
  • Травмы, мотивация, погода — да, даже это. В матче All Boys — Central Norte модель учла, что тотал 1-го таймачески редко превышает 0.5 — отсюда и прогноз УТ 0.5 за разумный кэф.

Какие модели работают в поле

Сегодня в индустрии беттинга правят ансамбли. Одна модель — это лотерея. Десять моделей — это статистика.

Вот наш топ-5:

XGBoost и LightGBM — градиентный бустинг, который отлично работает с табличными данными. Быстрые, точные, меньше склонны к переобучению, чем глубокие нейросети.

CatBoost — от Яндекса, хорош с категориальными признаками (города, стадионы, судьи).

Random Forest — простой, но надёжный бэкап. Хорош для оценки важности признаков.

Нейросети (LSTM, Transformer) — для последовательностей: серия матчей, динамика формы во времени.

В матче Santa Clara — Nacional ансамбль из 5 моделей показал 100% уверенность в победе хозяев с форой (-0.5) — и кэф 1.85 выглядел как подарок. Но помните: 100% в ML — это не гарантия, а консенсус алгоритмов.

Ансамбли: почему одна голова хорошо, а десять — лучше

Каждая модель ошибается по-своему. XGBoost может переоценить фаворита, нейросеть — недодать аутсайдеру. Ансамбль усредняет предсказания, и дисперсия падает.

В Fram Reykjavik — KR Reykjavik разные модели давали разброс: от 58% до 71% на тотал больше 2.5. Среднее — 65%, что при кэфе ~1.8 даёт положительное математическое ожидание. Вот тут и кроется валуй.

Показатели точности: во что верить

Не ведитесь на «90% точности» — это маркетинг. Смотрите на:

  • Brier Score — мера калибровки вероятностей. Чем ближе к 0, тем лучше.
  • Log Loss — штраф за самоуверенные ошибки.
  • ROI по банкам — главный показатель для беттера.

В Respublika FA — Aral модель показала 100% на ИТ хозяев > 0.5 — не потому что гол гарантирован, а потому что хозяева в среднем создают 1.8 xG за матч, а гости пропускают 2.1.

Итог

ИИ не гадает — он считает. Но считать надо правильно. Feature engineering, ансамбли, проверка на валидационных выборках — вот что отличает профессиональную модель от самоделке с Kaggle.

Мой совет: не ставьте на «уверенные» прогнозы вслепую. Сравнивайте вероятности модели с implied-вероятностью букмекера. Если расхождение больше 5-7% — ищите валуй. Именно так, как мы сделали это на KI Klaksvik — HB Torshavn (63% против кэф-рынка).

Удачи на дистанции, и помните: ML — это инструмент, а не волшебная палочка.

#модель #кэф #хозяев #валуй #чем

← Все новости