Top.Mail.Ru

🤖 AI-бенчмарк: проходимость 7 моделей

Прематч Лайв (in-play)

Семь внешних ИИ-моделей (Hermes-контур) независимо разбирают одни и те же матчи — прогноз исхода (1X2), тотала (ТБ/ТМ), обеих забьют (ОЗ) и точного счёта. Здесь мы честно сверяем их прогнозы с реальным результатом после финального свистка и сводим всё в один рейтинг точности. Информационно-аналитический срез, не рекомендация ставки.
Здесь ранжирование — по точности попадания (проходимости); доходность моделей в ставках (прибыль/ROI) — в «Виртуальном банке» на странице ИИ-агента. Поэтому лидеры двух страниц могут отличаться — это разные метрики.

⚠️ Данные накапливаются — подсчёт ведётся с 09.07.2026, чтобы все модели сравнивались на одних и тех же событиях (ранние тестовые прогнозы исключены). Выборка пока маленькая, не показательна. Сейчас в срезе 5162 матч(ей), 11786 расчётных прогнозов ИИ (Футбол, Теннис, Баскетбол, Волейбол, Хоккей, Настольный теннис). Цифры ниже — это N, а не «процент, которому можно верить»: чем больше матчей отыграется, тем увереннее будет срез. Мы показываем его прозрачно с первого дня, а не только когда выборка станет «удобной».
Лучшая проходимость исхода (1X2)
GPT 5.5
64.5%
167/259 исходов · 5162 матч.

Крупная цифра — проходимость исхода матча (1X2), как на главной. Полная таблица по всем рынкам (строже — с тоталом, ОЗ и точным счётом) и сводная точность — ниже.

Консенсус ИИ — когда все модели согласны
Единогласный прогноз исхода (≥4 моделей за один исход)
63.4%
571/901 единогласных · средняя модель 58.9%

🗳 Голосование большинством моделей (≥4 прогнозов на матч): 60.1% (725/1207). Единогласие — реже, но обычно точнее.

Единогласие по видам спортаЕдиногласныхПроходимость 1X2
Теннис 406 66.5% (270/406)
Футбол 287 54.0% (155/287)
Баскетбол 150 70.0% (105/150)
Волейбол 58 70.7% (41/58)

Таблица лидеров

Модель N (settled) 1X2 Двойной шанс (1X) Точный счёт Сводная точность
ChatGPT
259 64.5%(167/259) 74.6%(47/63) 16.9%(34/201) 43.7%(201/460)
Claude
2430 60.0%(1458/2430) 77.1%(737/956) 22.0%(475/2160) 42.1%(1933/4590)
Kimi
1091 60.3%(658/1091) 73.8%(254/344) 19.6%(186/947) 41.4%(844/2038)
DeepSeek
174 60.3%(105/174) 56.1%(23/41) 18.5%(32/173) 39.5%(137/347)
GLM 5.2
1266 59.2%(749/1266) 74.4%(303/407) 19.1%(237/1243) 39.3%(986/2509)
Google AI
5352 57.8%(3092/5350) 74.6%(1775/2378) 20.3%(1076/5312) 39.1%(4168/10662)
Qwen
1214 58.9%(715/1214) 75.0%(267/356) 16.6%(190/1145) 38.4%(905/2359)

серым — выборка <5, не показательно; «—» — модель ещё не дала расчётного прогноза.

Двойной шанс (1X) — тот же пик считается выигравшим, если выбранная сторона победила или случилась ничья. Из проигрышей 1X2 в футболе/хоккее: 1068 ничьи, 1139 андердог (всего расчётных пиков 1X2 в этих видах: 4545, двойной шанс совокупно 74.9% (3406/4545)). Модели почти всегда берут фаворита и не ставят на ничью — двойной шанс показывает, сколько ставок «съедают» именно ничьи.

Сводная точность — доля верных прогнозов по всем показанным рынкам вместе: (сумма угаданных пиков) ÷ (сумма всех рассчитанных пиков) по рынкам 1X2 + Точный счёт. Каждый рынок-пик весит одинаково. Это точность попадания, а не доходность — деньги/ROI по моделям смотрите на /ai-agent. «Точный счёт» — угадан итоговый счёт полностью (H и A совпали); для тенниса сравниваются сеты; прогнозы без распознанного счёта в знаменатель не идут. Двойной шанс (1X): пик считается выигравшим, если выбранная сторона победила ИЛИ ничья — учитывает частые ничьи, которые «съедают» ставки на фаворита. Показатель информационный и в сводную точность не входит. На «Все виды спорта» тотал и ОЗ не показываем — они привязаны к виду спорта и не имеют смысла в общем котле.

Сводный рейтинг моделей · все рынки

Высота столбца = сводная точность модели по всем применимым рынкам на текущей выборке. Сортировка от лучшей к худшей.

43.7% (201/460)
GPT 5.5
42.1% (1933/4590)
Opus 4.8
41.4% (844/2038)
Kimi 2.6
39.5% (137/347)
DeepSeek V4 Pro
39.3% (986/2509)
GLM 5.2
39.1% (4168/10662)
Gemini 3.5 Flash
38.4% (905/2359)
Qwen 3.7 Plus

Столбцы — модели ИИ по версиям; серым/приглушённо — выборка <5, не показательно. Срез информационный, не рекомендация ставки.

Точность по рынкам

Где каждая модель сильна: по одной мини-полосе на применимый рынок, с процентом и (попаданий/выборка).

ChatGPT Сводная 43.7%
1X2
64.5% (167/259)
Точный счёт
16.9% (34/201)
Claude Сводная 42.1%
1X2
60.0% (1458/2430)
Точный счёт
22.0% (475/2160)
Kimi Сводная 41.4%
1X2
60.3% (658/1091)
Точный счёт
19.6% (186/947)
DeepSeek Сводная 39.5%
1X2
60.3% (105/174)
Точный счёт
18.5% (32/173)
GLM 5.2 Сводная 39.3%
1X2
59.2% (749/1266)
Точный счёт
19.1% (237/1243)
Google AI Сводная 39.1%
1X2
57.8% (3092/5350)
Точный счёт
20.3% (1076/5312)
Qwen Сводная 38.4%
1X2
58.9% (715/1214)
Точный счёт
16.6% (190/1145)

Фаворит модели по 1X2 = максимум из P1/X/P2 в её вероятностях; для видов спорта без ничьей (теннис, волейбол и т.д.) вариант «Х» не участвует. серым — выборка <5, не показательно. Не рекомендация ставки.