Новые разделы!
ИИ, квантовые вычисления и много других интересных тем

Заходите в ЦИТадель!
Век живи — век учись

ИИ Ataraxos победил четырехкратного чемпиона мира по Stratego

Система Ataraxos выиграла 15 из 20 партий у одного из самых титулованных игроков в Stratego, проиграв одну встречу и завершив четыре вничью. Авторы исследования называют результат первым достижением сверхчеловеческого уровня в этой игре, при этом обучение обошлось в несколько тысяч долларов.

Исследователи из Университета Карнеги — Меллона, Массачусетского технологического института, Нью-Йоркского и Стэнфордского университетов описали систему Ataraxos в журнале Nature. В серии из 20 партий она одержала 15 побед над Пимом Нимейером — четырехкратным чемпионом мира по Stratego, — проиграла одну партию и четыре завершила вничью.

Матч продолжался три недели. Нимейер знал, что система не будет подстраиваться под его стиль между партиями, и мог искать уязвимости в ее стратегии.

Stratego — настольная военная игра с неполной информацией. Каждый участник начинает с 40 фигур, ранги которых скрыты от соперника и раскрываются только при столкновениях. Поэтому алгоритму приходится учитывать множество возможных вариантов расположения и типов оставшихся фигур.

Ataraxos обучалась с подкреплением в играх против самой себя. Отдельные трансформерные модели отвечают за начальную расстановку и выбор ходов, а вспомогательная модель оценивает вероятные типы скрытых фигур соперника и используется при поиске решения во время партии.

Основной этап обучения занял неделю на 16 ускорителях Nvidia H100, после чего модель оценки скрытых фигур обучали еще четыре дня на четырех H100. Авторы оценили общие расходы в несколько тысяч долларов. Разработанные методы также проверили в Barrage Stratego, Hanabi и китайской карточной игре доу дичжу; исходный код экспериментов опубликован на GitHub.

Источник: nature.com

Связь с редакцией