Я вчера три часа разбирал матч Flora II — Nõmme Kalju II, и знаете, что удивило? Модель дала 62% на победу хозяев, а букмекер предлагал кэф, который явно завышен. Вот тут-то и рождается валуй — и именно об этом мы поговорим.
С чего всё начинается: feature engineering
Прежде чем любая нейросеть выдаст прогноз, ей нужно «скармлиать» данные. Я часто говорю новичкам: мусор на входе — мусор на выходе. Что мы скармливаем моделям?
- xG (ожидаемые голы) — не просто голы, а качество моментов. Команда забила 2, но xG был 0.4 — это красный флаг.
- Glicko-2 — рейтинговая система, которая учитывает не только победы, но и силу соперника. Простой Elo тут мимо кассы.
- Форма последних 5-10 матчей — но не просто W-D-L, а взвешенная по времени: последние игры весят дороже.
- Травмы, мотивация, погода — да, даже это. В матче All Boys — Central Norte модель учла, что тотал 1-го таймачески редко превышает 0.5 — отсюда и прогноз УТ 0.5 за разумный кэф.
Какие модели работают в поле
Сегодня в индустрии беттинга правят ансамбли. Одна модель — это лотерея. Десять моделей — это статистика.
Вот наш топ-5:
XGBoost и LightGBM — градиентный бустинг, который отлично работает с табличными данными. Быстрые, точные, меньше склонны к переобучению, чем глубокие нейросети.
CatBoost — от Яндекса, хорош с категориальными признаками (города, стадионы, судьи).
Random Forest — простой, но надёжный бэкап. Хорош для оценки важности признаков.
Нейросети (LSTM, Transformer) — для последовательностей: серия матчей, динамика формы во времени.
В матче Santa Clara — Nacional ансамбль из 5 моделей показал 100% уверенность в победе хозяев с форой (-0.5) — и кэф 1.85 выглядел как подарок. Но помните: 100% в ML — это не гарантия, а консенсус алгоритмов.
Ансамбли: почему одна голова хорошо, а десять — лучше
Каждая модель ошибается по-своему. XGBoost может переоценить фаворита, нейросеть — недодать аутсайдеру. Ансамбль усредняет предсказания, и дисперсия падает.
В Fram Reykjavik — KR Reykjavik разные модели давали разброс: от 58% до 71% на тотал больше 2.5. Среднее — 65%, что при кэфе ~1.8 даёт положительное математическое ожидание. Вот тут и кроется валуй.
Показатели точности: во что верить
Не ведитесь на «90% точности» — это маркетинг. Смотрите на:
- Brier Score — мера калибровки вероятностей. Чем ближе к 0, тем лучше.
- Log Loss — штраф за самоуверенные ошибки.
- ROI по банкам — главный показатель для беттера.
В Respublika FA — Aral модель показала 100% на ИТ хозяев > 0.5 — не потому что гол гарантирован, а потому что хозяева в среднем создают 1.8 xG за матч, а гости пропускают 2.1.
Итог
ИИ не гадает — он считает. Но считать надо правильно. Feature engineering, ансамбли, проверка на валидационных выборках — вот что отличает профессиональную модель от самоделке с Kaggle.
Мой совет: не ставьте на «уверенные» прогнозы вслепую. Сравнивайте вероятности модели с implied-вероятностью букмекера. Если расхождение больше 5-7% — ищите валуй. Именно так, как мы сделали это на KI Klaksvik — HB Torshavn (63% против кэф-рынка).
Удачи на дистанции, и помните: ML — это инструмент, а не волшебная палочка.
#модель #кэф #хозяев #валуй #чем