Цели и задачи дисциплины
Цель дисциплины: Формирование системных теоретических знаний и практических навыков в области проектирования, обучения и анализа многоагентных систем искусственного интеллекта, функционирующих в сложных стохастических и частично наблюдаемых средах.
Задачи дисциплины:
Изучение математического аппарата для описания одноагентных и многоагентных взаимодействий.
Изучение фундаментальных проблем MARL.
Освоение современных архитектур глубокого многоагентного обучения.
Краткое содержание дисциплины
Одноагентный обучение с подкреплением: марковские процессы принятия решений (MDP), методы динамического программирования, безмодельные алгоритмы (Q-Learning) и современные архитектуры глубокого обучения с подкреплением (DQN, PPO, SAC).
Многоагентные обучение с подкреплением: теория игр, Марковские игры и децентрализованным POMDP.
Ключевые проблемы многоагентного обучения с подкреплением: нестационарность среды, проблему распределения вклада (Credit Assignment) и частичную наблюдаемость.