Сегодня 11 июня 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

ИИ оказался никудышным в ставках на спорт — он проиграл всё на матчах английской Премьер-лиги

Модели искусственного интеллекта от Google, OpenAI, Anthropic и xAI потеряли виртуальные деньги, делая ставки на футбольные матчи в течение сезона английской Премьер-лиги в рамках эксперимента, который провёл стартап General Reasoning. Результаты опыта показывают, что даже передовые системы испытывают трудности при анализе событий реального мира в долгосрочной перспективе, пишет Financial Times.

 Источник изображения: Sven Kucinic / unsplash.com

Источник изображения: Sven Kucinic / unsplash.com

Исследователи из стартапа General Reasoning опубликовали результаты проекта KellyBench — его итоги, считают они, подтверждают, что ИИ может успешно решать такие задачи как написание программного кода, но он неспособен ориентироваться во многих других аспектах реальной человеческой жизни. В рамках эксперимента компания протестировала восемь лучших систем ИИ в виртуальной реконструкции сезона Премьер-лиги 2023–2024 годов, предоставив им подробную статистику по каждой команде и предыдущим играм. ИИ было поручено сформировать модели, с помощью которых можно извлекать максимальную прибыль и управлять рисками.

Условные ИИ-агенты делали ставки на исходы матчей и количество забитых голов, чтобы проверить, способен ли ИИ адаптироваться к новым событиям и обновляющимся по мере развития сезона данным об игроках. Доступа к интернету у моделей ИИ в рамках эксперимента не было, и у каждой модели было по три попытки заработать. Лучше всех проявил себя Anthropic Claude Opus 4.6 со средним убытком 11 % и почти безубыточностью в одной из попыток. Чат-бот xAI Grok 4.20 сразу обанкротился и не смог завершить две оставшиеся попытки; Google Gemini 3.1 Pro получил прибыль в 34 % в первой попытке и обанкротился во второй. В итоге каждая из передовых моделей теряла деньги в течение сезона, и многие просто обанкротились, отметили исследователи — в этой задаче ИИ выступил явно хуже человека.

Результаты эксперимента, подчёркивают его авторы, указывают, что опасения общественности по поводу вытеснения человека ИИ пока беспочвенны, и в долгосрочной перспективе ИИ пока несостоятелен. Многие из бенчмарков, в которых оцениваются модели, описывают «очень статичные условия», имеющие не так много общего с хаосом и сложностью реального мира. И если ИИ преуспевает в написании программного кода, то во многих других видах человеческой деятельности он всё ещё бесполезен.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Вид от третьего лица, смена названия и полный перевод на русский: Capcom раскрыла новые подробности Resident Evil Veronica 15 мин.
Студенты теряют способность читать и усваивать прочитанное — виноват ИИ 58 мин.
Успевший поработать в xAI, OpenAI и Google Игорь Бабушкин основал собственный ИИ-стартап 2 ч.
Китай возродил ботнеты и начал разжигать споры по поводу ЦОД для ИИ в США 2 ч.
Visa открыла ИИ-агентам OpenAI возможность оплачивать покупки от имени пользователей 2 ч.
Глава Anthropic: правительство должно иметь право ограничивать опасные ИИ-модели 2 ч.
Немецкий суд возложил на Google ответственность за ошибки в «Обзорах от ИИ» 3 ч.
Ubisoft закрыла ещё две студии и уволила несколько сотен сотрудников 3 ч.
Xiaomi представила ИИ-агента для программирования MiMo Code — он хорошо помнит, что делает 4 ч.
Pearl Abyss похвасталась успехами Crimson Desert — игра покорила новую вершину продаж 4 ч.
Китай хочет уже в этом году видеть человекоподобных роботов не на танцполе, а на складах и в больницах 53 мин.
OpenAI рассматривает аренду кампуса ЦОД в Огайо мощностью 10 ГВт с поддержкой NVIDIA 55 мин.
Китайцы переполошились из-за змеи на проводах ЛЭП — это оказался робот-инспектор 2 ч.
Российские учёные первыми получили китайские образцы с обратной стороны Луны 3 ч.
Предложенная ЕС система рейтингов экоэффективности ЦОД может ударить по финансированию ИИ-проектов 3 ч.
AMD заявила, что процессоры Epyc на Zen 6 будут до 3,3 раза быстрее Nvidia Vera в расчёте на стойку 4 ч.
СЖО и 1,6 Тбит/с на порт: Arista представила коммутаторы 7060XE7 для ИИ ЦОД 4 ч.
Глава Xbox подвела итоги своих первых ста дней на посту и наметила перезагрузку «нездорового» подразделения 4 ч.
Учёные из MIT на коленке освоили 3D-печать для бигфармы и биотеха 4 ч.
Чтобы потратить в этом году $70 млрд на ЦОД, компании Oracle придётся занять $40 млрд 5 ч.