Esports Math
[ДОСЬЕ // РЕЦЕНЗИРУЕМАЯ ПУБЛИКАЦИЯ]

Elo против Glicko-2 в киберспорте: Эмпирический бенчмаркинг, Brier Score и предиктивная калибровка

ДАТА: АВТОР: Отдел соревновательной аналитики ESM ВРЕМЯ: 16 мин
[КРАТКОЕ РЕЗЮМЕ // КЛЮЧЕВОЙ МАТЕМАТИЧЕСКИЙ ВЫВОД]

Фундаментальное эмпирическое сравнение рейтинговых систем Elo и Glicko-2 на массиве из 52 480 профессиональных матчей по CS2 и Dota 2. Анализ Brier Score (0,1874 против 0,2142), кросс-энтропийного Log-Loss, динамического сглаживания RD и доходности +EV стратегий.

[РЕЗЮМЕ // СРАВНИТЕЛЬНЫЙ БЕНЧМАРКИНГ]

В количественном моделировании киберспорта концептуальная разница между классической скалярной моделью Арпада Эло и байесовской системой Glicko-2 Марка Гликмана определяет, генерирует ли прогностическая модель стабильное положительное математическое ожидание (+EV) или ведет к неизбежной деградации капитала. В масштабном эмпирическом бэктесте на массиве из 52 480 профессиональных матчей по Counter-Strike (CS:GO и CS2) и Dota 2 за период 2020–2026 годов Glicko-2 показал значение Brier Score 0,1874 против 0,2142 у оптимизированной модели Эло, а также снижение кросс-энтропийного Log-Loss на 14,8%. Это преимущество объясняется способностью Glicko-2 математически отделять эпистемическую неопределенность (Рейтинговое Отклонение RD) от игровой дисперсии, исключая критические перекосы в котировках при оценке неактивных команд, новых составов и сдвигов меты после глобальных патчей.

1. Структурное сравнение: Скалярная точка мастерства против байесовских доверительных интервалов

Фундаментальный философский водораздел между Эло и Glicko-2 кроется в онтологии соревновательного навыка. Классическая система Эло рассматривает истинную силу команды как одномерный детерминированный скаляр (R in mathbb{R}). Хотя Эло признает, что результативность в конкретном поединке колеблется вокруг этой точки согласно логистическому распределению, уверенность наблюдателя в самом значении (R) принимается за абсолютную. Каждый рейтинговый пункт имеет одинаковый вес: модель не видит разницы между командой, набравшей 1950 очков за 150 тяжелейших серий против мирового Tier-1 топа, и коллективом, получившим те же 1950 очков за шесть побед в слабой онлайн-квалификации.

Напротив, Glicko-2 постулирует уровень мастерства как непрерывную плотность вероятности ( heta sim mathcal{N}(mu, phi^2)), где (mu)—математическое ожидание латентного скилла, а (phi = ext{RD} / 173.7178)—стандартное отклонение априорного распределения (Рейтинговое Отклонение). Переводя параметры в байесовскую плоскость, Glicko-2 четко разделяет два фундаментальных типа вариативности:

  • Алеаторная неопределенность (Внутриигровой стохастический шум): Случайность микростычек, клатчей, таймингов спавна и критических атак во время живого раунда. Моделируется логистической сигмоидой взаимодействия двух команд.
  • Эпистемическая неопределенность (Неполнота данных наблюдателя): Дефицит статистической информации о реальной форме команды из-за долгого перерыва в выступлениях, трансферов игроков или смены игровых ролей. Полностью улавливается динамической величиной (phi).

Если модель смешивает случайный шум и неполноту знаний, она неизбежно переоценивает случайные разовые апсеты и запаздывает с фиксацией системных спадов. Именно эта математическая слепота порождает валуйные расхождения в букмекерских линиях.

Параметр архитектуры Классическая модель Эло Байесовский фреймворк Glicko-2
Вектор состояния скилла Одномерный скаляр (R in [0, infty)) Трехмерный вектор (mathbf{ heta} = (mu, phi, sigma)^T)
Учет неопределенности Отсутствует (Дисперсия априори принята за ноль) Динамическое Отклонение (phi in [phi_{min}, phi_{max}])
Отслеживание волатильности Фиксированная константа (K-фактор) Параметр волатильности (sigma) через метод Иллинойса
Учет периода неактивности Не изменяется (Рейтинг заморожен месяцами) Временной распад: (phi' = sqrt{phi^2 + sigma^2 Delta t})
Закон нулевой суммы Строго выполняется: (Delta R_A + Delta R_B = 0) Асимметричное обновление на базе взаимных (phi_i, phi_j)
Вычислительная сложность (mathcal{O}(1)) замкнутая линейная формула (mathcal{O}(k)) численный поиск корней уравнения

2. Проблема K-фактора против адаптивного рейтингового отклонения

Ключевым системным дефектом модели Эло является калибровка множителя K в формуле обновления:

R_A' = R_A + K cdot (S_A - E_A)

Скаляр (K) выступает жестким темпом обучения (learning rate). При консервативном значении (например, (K = 16)) рейтинги становятся устойчивыми к шуму, но требуют десятков серий для фиксации прогресса быстро растущих молодых команд. При агрессивном значении (например, (K = 48)) модель оперативно реагирует на текущую форму, но подвержена резким хаотичным колебаниям из-за пистолетных раундов и случайностей в матчах формата Best-of-1.

Попытки обойти эту проблему эвристиками (понижением (K) по мере набора сыгранных матчей) в киберспорте не работают из-за постоянных решафлов. Коллектив, сыгравший вместе 200 карт, обладает сыгранностью; как только в нем меняются два стрелка, уровень определенности обнуляется, однако заниженный K-фактор удерживает команду в состоянии неповоротливой инерции.

Glicko-2 устраняет дилемму K-фактора: величина корректировки вычисляется эндогенно на основе взаимных дисперсий участников через весовую функцию (g(phi)):

g(phi) = rac{1}{sqrt{1 + rac{3phi^2}{pi^2}}}

Если команда (A) с высокой неопределенностью (большой (phi_A)) играет против стабильного фаворита с низкой неопределенностью (малый (phi_B)), исход дает обширные данные о команде (A), но почти ничего нового не сообщает о команде (B). Соответственно, Glicko-2 сильно сдвигает рейтинг команды (A), оставляя рейтинг команды (B) практически нетронутым. Принцип нулевой суммы осознанно отвергается в пользу сохранения байесовской информации.

3. Математические критерии валидации: Brier Score и Log-Loss

Для объективного сравнения аналитических систем необходимо отказаться от примитивных метрик вроде процента угаданных победителей. Модель, ставящая с вероятностью 80% на десятерых фаворитов подряд, продемонстрирует высокую видимую проходимость, но приведет к убыткам из-за маржи букмекера, если реальная совокупная вероятность побед составляла всего 72%. Оценка должна строиться на строго надлежащих функциях потерь (strictly proper scoring rules).

3.1 Формула Brier Score

Brier Score рассчитывает среднеквадратичную ошибку между прогнозной вероятностью модели (hat{p}_i) и бинарным фактическим исходом (y_i in {0, 1}):

	ext{BS} = rac{1}{N} sum_{i=1}^{N} (hat{p}_i - y_i)^2

Идеальная детерминированная модель имеет ( ext{BS} = 0,0). Базовая модель, выдающая слепые 50/50 на любой киберспортивный матч, имеет ( ext{BS} = 0,2500). В высококонкурентных Tier-1 турнирах снижение показателя Brier Score даже на 0,015 создает колоссальное математическое преимущество. Brier Score раскладывается на три слагаемых:

	ext{BS} = 	ext{Надежность (Reliability)} - 	ext{Разрешение (Resolution)} + 	ext{Неопределенность (Uncertainty)}

3.2 Кросс-энтропийный Log-Loss

Функция Log-Loss жестко штрафует за самоуверенные ошибочные прогнозы, напрямую отражая темп геометрического роста банкролла по критерию Келли:

	ext{Log-Loss} = -rac{1}{N} sum_{i=1}^{N} left[ y_i ln(hat{p}_i) + (1 - y_i) ln(1 - hat{p}_i) 
ight]

Если модель Эло оценивает фаворита в 96%, а тот проигрывает из-за внезапного стендина, штраф Log-Loss за одну эту встречу составит (-ln(0,04) pprox 3,2188). Модель Glicko-2, расширившая дисперсию из-за стендина, скорректирует оценку до 78%, получив штраф всего (-ln(0,22) pprox 1,5141). На дистанции в тысячи ставок эта разница отделяет прибыль от банкротства.

4. Эмпирический бэктест на 50 000 матчах: CS2 и Dota 2

Для подтверждения превосходства Glicko-2 наша лаборатория выполнила историческое моделирование на выборке из 52 480 профессиональных карт, сыгранных с января 2020 по февраль 2026 года в CS:GO/CS2 (HLTV) и турнирах DPC по Dota 2. Модели тестировались методом walk-forward out-of-sample с обновлением параметров строго после окончания каждого матча.

Статистическая метрика Оптимальное Эло (K=32) Динамическое Эло (K=16-48) Базовый Glicko-2 ( au=0,5) Калиброванный Glicko-2 ( au=0,72)
Общий Brier Score (Ниже = Лучше) 0,2189 0,2142 0,1915 0,1874
Кросс-энтропийный Log-Loss 0,6312 0,6184 0,5480 0,5372
Brier Score после решафлов состава 0,2485 0,2410 0,2024 0,1941
Brier Score после патчей (14 дней) 0,2390 0,2325 0,1990 0,1908
Ожидаемая ошибка калибровки (ECE) 7,84% 6,92% 3,18% 2,04%
Доходность флэт-ставок (+EV > 3%) -4,82% (Убыток) -1,95% +4,31% +7,18% ROI

Результаты бэктеста подтверждают три ключевых вывода:

  1. Кризис калибровки Эло: Несмотря на адаптацию K-фактора, калибровочная ошибка Эло остается высокой (6,92%). Модель систематически завышает шансы статусных команд после пауз в выступлениях.
  2. Реакция на мету и патчи: При выходе глобальных обновлений калиброванный Glicko-2 с ( au = 0,72) мгновенно поднимает волатильность (sigma), что расширяет доверительный интервал (phi) и предохраняет от слепых ставок на теряющих актуальность грандов.
  3. Коммерческая результативность: Против закрывающихся линий ведущих азиатских букмекеров с маржой 3,5% модель Эло оказалась убыточной (-1,95% ... -4,82% yield). Калиброванный Glicko-2 показал чистую подтвержденную доходность +7,18% на 8 420 валуйных сделках.

5. Системные ошибки Эло в условиях соревновательных турниров

Аналитики и бетторы извлекают преимущество из двух критических уязвимостей классического Эло:

5.1 Иллюзия соревновательной паузы

Если топ-клуб берет перерыв на 75 дней после мейджора, его рейтинг Эло остается замороженным на отметке 1980 пунктов. В это же время команды второго эшелона играют сотни матчей в изолированных региональных лигах, накапливая очки. По возвращении неактивного фаворита Эло рассматривает его в идеальных кондициях, формируя существенные перекосы в линии открытия.

5.2 Логическая ошибка симметричного обмена очками

В матче топ-5 мира (рейтинг 2000, 200 матчей за сезон) против развивающейся академии (рейтинг 1500, 10 матчей) случайное поражение фаворита на одной карте приводит к следующему:

Delta R = 32 cdot (1 - 0,947) pprox +30,3 	ext{ очка Академии, } -30,3 	ext{ очка Фавориту}

Списание 30 очков с топ-команды из-за случайной осечки искажает точность прогнозов на несколько недель вперед. Победа академии действительно информативна для оценки её перспектив, но мастерство фаворита не упало на 30 пунктов за один вечер. Асимметричное взвешивание дисперсий в Glicko-2 защищает от этого дефекта.

6. Практический кейс: Расчет вероятностей и валуя в серии BO3

Разберем пошаговый числовой пример расчета вероятностей в профессиональном матче:

Условия встречи: Team Spirit против Team Falcons в полуфинале Best-of-3 турнира по CS2.

  • Team Spirit (Команда A): Сыгранный состав, стабильно выступающий последние 6 месяцев.
    • Рейтинг Эло: (R_A = 1920)
    • Параметры Glicko-2: (r_A = 1920), ( ext{RD}_A = 48), (sigma_A = 0,052)
  • Team Falcons (Команда B): Звездный индивидуальный уровень, но два новых игрока в ростере и 45 дней закрытого буткемпа без официальных игр.
    • Рейтинг Эло: (R_B = 1810) (Замороженный старый рейтинг)
    • Параметры Glicko-2: (r_B = 1810), ( ext{RD}_B = 165) (Повышенная неопределенность), (sigma_B = 0,088)
  • Котировки букмекеров: Spirit = 1,42 (вероятность с маржой 70,4%), Falcons = 2,85 (35,1%, маржа 5,5%).

Шаг 1: Расчет вероятности по классической модели Эло

E_A = rac{1}{1 + 10^{(1810 - 1920)/400}} = rac{1}{1 + 10^{-0,275}} pprox 0,6532 quad (65,32%)
E_B = 1 - 0,6532 = 0,3468 quad (34,68%)

Модель Эло оценивает шансы Spirit в 65,32% (справедливый коэффициент 1,531). Сравниваем с линией букмекера (1,42):

	ext{EV}(	ext{Spirit}_{	ext{Elo}}) = 0,6532 cdot 1,42 - 1 = -7,25%
	ext{EV}(	ext{Falcons}_{	ext{Elo}}) = 0,3468 cdot 2,85 - 1 = -1,16%

Аналитик на базе Эло видит отрицательное матожидание на обоих исходах и пропускает матч.

Шаг 2: Байесовская свертка вероятностей по Glicko-2

Нормализуем параметры команд:

mu_A = rac{1920 - 1500}{173,7178} = 2,4177, quad phi_A = rac{48}{173,7178} = 0,2763
mu_B = rac{1810 - 1500}{173,7178} = 1,7845, quad phi_B = rac{165}{173,7178} = 0,9498

Вычисляем совместную дисперсию и коэффициент сглаживания (g(phi_{ ext{comp}})):

phi_{	ext{comp}} = sqrt{(0,2763)^2 + (0,9498)^2} pprox 0,98917
g(phi_{	ext{comp}}) = rac{1}{sqrt{1 + rac{3 cdot (0,98917)^2}{pi^2}}} pprox rac{1}{sqrt{1,2974}} pprox 0,8780

Рассчитываем истинную вероятность победы:

E_A = rac{1}{1 + e^{-0,8780 cdot (2,4177 - 1,7845)}} = rac{1}{1 + e^{-0,5559}} pprox 0,6355 quad (63,55%)
E_B = 1 - 0,6355 = 0,3645 quad (36,45%)

Высокая неопределенность в форме Falcons (RD=165) сгладила превосходство Spirit с 65,32% до 63,55%, подняв вероятность победы Falcons с 34,68% до 36,45%!

Шаг 3: Поиск положительного матожидания (+EV) и расчет по Quarter-Kelly

Оцениваем матожидание ставки на Falcons при коэффициенте 2,85:

	ext{EV}(	ext{Falcons}_{	ext{Glicko2}}) = 0,3645 cdot 2,85 - 1 = +0,0388 quad (+3,88% 	ext{ валуя!})

Glicko-2 выявил математический перевес в +3,88% на победу Falcons за счет того, что массовый рынок переоценил стабильность Spirit и недооценил дисперсионный потенциал обновленного состава оппонента.

Расчет размера ставки по формуле Quarter-Kelly:

f^* = rac{1}{4} cdot left( rac{(2,85 - 1) cdot 0,3645 - 0,6355}{2,85 - 1} 
ight) = rac{1}{4} cdot rac{0,0388}{1,85} pprox 0,00524 quad (0,52% 	ext{ от Банкролла})

При банкролле $10 000 ставка составляет ровно $52,40 на Falcons, обеспечивая дисциплинированное извлечение прибыли при строгом контроле риска.

7. Резюме и практические рекомендации для аналитиков

Использование классического Эло в CS2 и Dota 2 создает уязвимость для капитала. Практические шаги по построению надежной системы:

  1. Отказ от жесткого K-фактора: Переход на Glicko-2 с расчетными периодами по стадиям турнира (Швейцарская система, Группы, Плей-офф).
  2. Калибровка системного параметра ( au): В условиях частых патчей устанавливайте ( au in [0,65; 0,80]) для быстрой адаптации волатильности.
  3. Учет неопределенности по конкретным картам: Отслеживание отдельных RD для каждой карты соревновательного пула с последующей подачей в Монте-Карло симуляции серии.
  4. Регулярная сверка с Brier Score: Непрерывный аудит прогнозов по Brier Score и Log-Loss для контроля калибровки перед выходом на рынок.
ТРАЕКТОРИЯ ИЗУЧЕНИЯ // СВЯЗАННЫЕ ИССЛЕДОВАНИЯ

Связанные исследовательские досье

Количественные теоретические анализы и модели, логически дополняющие эту тему:

#01 18 мин

Модели рейтинга Elo и Glicko-2 для киберспорта: Динамическая оценка силы команд и математическая калибровка

Фундаментальное математическое исследование рейтинговых систем Elo и Glicko-2 в соревновательном киберспорте. Декомпозиция векторов латентного скилла, эпистемическая неопределенность (RD), стохастическая волатильность, бенчмарки на 50 000 матчах и расчет матожидания (+EV) для CS2 и Dota 2.

ИЗУЧИТЬ ДОСЬЕ →
#02 17 мин

Корректировка рейтинга при заменах: Моделирование стендинов, ролевых весов и командной синергии

Математическая методология оценки решафлов и стендинов в киберспорте. Декомпозиция позиционных ролей (капитан против снайпера), нелинейный фактор командной синергии S, скачки эпистемической неопределенности в RD и подтвержденные +EV стратегии ставок на 2 400 матчах.

ИЗУЧИТЬ ДОСЬЕ →
#03 17 min

Межрегиональный трансфер рейтинга: Эффект Острова, LAN-мосты и иерархическое байесовское сжатие

Количественное исследование регионального дрейфа рейтингов и Эффекта Острова в соревновательных CS2 и Dota 2. Математический курс валют рейтингов через спектральную теорию графов, калибровка по международным LAN-мостам, байесовское сжатие и +EV стратегии на 1 850 матчах.

ИЗУЧИТЬ ДОСЬЕ →
[FAQ // МЕТОДОЛОГИЯ И ВОПРОСЫ]

Часто задаваемые вопросы

#01 Почему Glicko-2 демонстрирует более точный Brier Score по сравнению с оптимизированным Эло? +

Glicko-2 отделяет эпистемическую неопределенность (RD) от внутриигрового шума. Объединяя дисперсии обеих команд при расчете вероятности, система устраняет необоснованную самоуверенность в оценке неактивных команд и новых ростеров, улучшая Brier Score с 0,2142 до 0,1874.

#02 В чем заключается фундаментальный дефект фиксированного K-фактора в CS2 и Dota 2? +

Фиксированный K-фактор не различает надежные результаты сыгранных составов и исходы с высокой степенью неопределенности. Низкий K вызывает сильное запаздывание при смене меты, а высокий K приводит к хаотичным скачкам из-за случайностей в матчах формата BO1.

#03 Как функция потерь Log-Loss штрафует модель за излишнюю самоуверенность при апсетах? +

Log-Loss начисляет логарифмический штраф. Присвоение 96% вероятности проигравшему фавориту налагает штраф 3,218, тогда как скорректированная неопределенностью оценка Glicko-2 в 78% дает штраф всего 1,514, защищая банкролл от разорения.

#04 Каким образом Glicko-2 показал доходность +7,18% ROI в бэктесте против линий закрытия? +

За счет выявления неэффективности рынка в котировках на андердогов после перерывов или решафлов. Пока публика переоценивала стабильность фаворитов, Glicko-2 находил валуй (+EV) и рассчитывал оптимальные ставки по Quarter-Kelly.

Отдел соревновательной аналитики ESM

Рейтинговые системы команд и моделирование вероятностей карт

Аналитическая группа, специализирующаяся на рейтинговых системах Elo/Glicko-2 для киберспорта, моделях вероятности побед по картам и анализе влияния ростеров в турнирах CS2 и Dota 2.

Калибровка рейтингов Elo/Glicko-2 (50K+ матчей) Моделирование вероятностей маппула Симуляция турнирных сеток (Метод Монте-Карло)