2024年,全球AI代理市场规模估计为59亿美元,预计到2034年将增长至1056亿美元,年复合增长率38.5%(GMI《AI Agents Market Report 2025-2034》)。其中,多智能体系统平台市场的增速更为激进:Mordor Intelligence预测其将从2026年的115.4亿美元扩张到2031年的785.3亿美元,CAGR高达46.76%。

数据另一面是落地难的现实。IDC《AI Agent企业级应用现状与推荐,2025》显示,中国企业AI Agent应用仍处于追赶阶段,仅34%受访企业开展测试验证,30%进入较大投入阶段。Mordor Intelligence在同年报告中援引LinkedIn 2025 AI Talent Gap Report的数据:68%的企业难以招聘到掌握多智能体通信和分布式强化学习的工程师。市场规模和人才供给之间的缺口,正在快速拉大。

多智能体系统不是简单的“单智能体×N”。当多个决策主体同时存在、策略相互影响时,环境本身变得非平稳,均衡求解、策略收敛、收益分配都成为必须面对的理论问题。大多数团队缺的不是调包能力,而是把博弈论从公式翻译成可运行代码的底层功。上海交通大学ACM班俞勇教授团队编写的《动手学博弈论》,处理的就是这个断层。

最初,博弈论主要服务于经济学和社会科学,用于解释市场竞争、竞选博弈等现象。随着计算机技术和人工智能(artificial intelligence,AI)的兴起,博弈论在智能系统中的作用日益凸显。许多 AI 问题本质上可以抽象为博弈问题——多智能体互动、竞争或合作,以实现各自目标。

在 AI 的发展过程中,游戏扮演了关键角色,早期的计算机游戏程序(如国际象棋和围棋算法)就是智能的试金石。而如今,博弈论的原理已成为全球一些最先进智能系统的核心。AI 的最新进展也反过来推动了博弈论研究的复兴和创新。

换言之,博弈论不仅是经济学的理论支柱,也日益成为 AI 领域理解决策与交互的利器。

Part.1

全书内容整体框架

《动手学博弈论》全书分为五大部分,共28章,遵循「静态博弈→动态博弈→合作博弈→马尔可夫决策过程与随机博弈→多智能体协作」由浅入深的逻辑,完整覆盖博弈论基础理论、均衡求解算法、马尔可夫随机博弈、主流多智能体深度强化学习算法,每一个核心概念配套场景案例 + 完整 Python 代码,兼顾理论推导与工程实操。

图片

Part.2

高频卡点与书中解决方案

1. 只会深度学习,不会把交互场景抽象成标准博弈模型

很多从业者能搭建神经网络,但无法将竞价、机器人协作、车辆交互等场景转化为收益矩阵、博弈树标准模型。

本书第 1-11 章完整覆盖标准式、扩展式博弈建模流程,以囚徒困境、匹配硬币、Kuhn 扑克、最后通牒博弈等案例,给出收益矩阵构造、博弈树绘制、信息集合划分完整代码;同时讲解支撑枚举、虚拟对弈、反事实遗憾最小化(CFR)三类纳什均衡数值求解方法,可直接复现猜拳、扑克博弈均衡计算。

图片

2. 多智能体训练环境持续波动,算法难以收敛

多智能体同步更新带来的非平稳性是落地第一大障碍,传统单智能深度Q学习网络(DQN)、近端策略优化(PPO)直接复用极易出现策略震荡。

本书第四、五部分针对性给出两套成熟解决路径:一是随机博弈框架下虚拟对弈、PHC、WoLF 等传统多智能体学习算法;二是工业常用 CTDE 架构算法。书中给出完整 PyTorch 实现。

3. 团队共享奖励,无法分配各智能体贡献(信用分配问题)

集群机器人、资源收集类合作任务中,全局统一奖励无法区分个体行为价值,会出现 “懒惰智能体”,训练效率极低。

第 25 章专门讲解值函数分解体系,区分线性分解 VDN(值分解网络) 与单调分解 QMIX,推导 IGM 个体全局最大性质,通过超网络约束混合网络参数恒正,保证去中心化动作等价于全局最优联合动作,配套完整智能体 Q 网络、混合网络、超网络可运行代码。

4. 动态对抗、不完全信息场景缺少成熟求解工具

网络攻防、多人扑克、动态竞价属于不完全扩展式博弈,常规纯策略枚举完全失效。

第 7~10 章讲解扩展式博弈树、逆向归纳法、CFR,以 Kuhn 扑克为完整工程案例,分步实现博弈树遍历、遗憾值迭代、平均策略输出,可迁移到任意不完全信息对抗仿真场景。

图片

5. 合作联盟收益分配缺少量化计算方法

供应链联盟、合作社、团队分成等场景需要公平收益分配机制,夏普利值、核、核仁是行业标准解法。

12~15 章完整讲解合作博弈特征函数、核与核仁求解、夏普利值计算,结合满减优惠、农业合作社案例,提供夏普利值枚举计算代码,可直接用于业务收益分配建模。

图片

Part.3

不同场景下的阅读路径

● 如果你正在做自动驾驶或多机器人协作,策略训练不收敛或协作效果差,建议从第22章开始补深度强化学习基础,然后进入第23~26章的多智能体算法,重点看VDN、QMIX和多智能体近端策略优化(MAPPO)的代码实现。

● 如果你从事广告竞价、推荐系统或机制设计,需要理解均衡行为和收益分配,第4~6章的纳什均衡求解、第10章的CFR、第12~15章的合作博弈是核心章节。

● 如果你做博弈论或多智能体强化学习研究,需要可运行代码来验证论文算法,全书覆盖的支撑枚举法、虚拟对弈、CFR、DQN、PPO、QMIX、MAPPO、蒙特卡洛树搜索(MCTS)、策略空间响应预言(PSRO)均可直接参考。

● 如果你是计算机或AI专业学生,想找一本从博弈基础到多智能体前沿的教材,28章按顺序推进即可。每章都有场景引入和代码实验,不需要经济学先修背景。

Part.4

这本书得到了多位业内权威专家的推荐

随着人工智能的快速发展,多智能体交互逐渐成为领域核心研究方向,博弈论也随之成为该领域不可或缺的理论支撑。本书应时而作,开创性地将博弈论基础理论、多智能体交互机制与强化学习深度融合,为多智能体人工智能的发展筑牢理论基础并提供实践指导。本书行文深入浅出,兼具通俗性与实用性:既有浅显易懂的基础理论解读,又有引人入胜的真实案例剖析,更配套实操代码与理论解读视频,易学易用,是广大人工智能从业者案头必备的优质参考资源。

——鄂维南 院士,上海交通大学人工智能学院首席顾问

随着人工智能走向真实世界,多智能体间的协作、竞争与动态适应愈发关键,而博弈论正是最适合解析此类交互的理论工具。本书将经典博弈论理论与现代智能体学习技术联系起来,引导读者从“交互”视角构建对人工智能系统的认知。我深信,本书将为广大读者叩开多智能体与智能决策领域的大门。

——安波 南洋理工大学教授

多智能体系统的核心难点在于智能体并非彼此孤立:单一智能体的策略调整,会直接影响其他智能体的感知、学习与决策行为。本书紧扣这一核心难点,将博弈论与现代人工智能中的智能体交互场景紧密联系起来,帮助读者直观理解多智能体间的协作、竞争与动态适应逻辑。本书绝非空谈理论,而是能切实引导读者深耕交互式智能领域的实用佳作。

——汪军 伦敦大学学院教授

随着强化学习和多智能体系统的不断发展,博弈论已然成为人工智能教学体系中不可或缺的基础内容。本书面向计算机与人工智能相关专业学生,将博弈思想与智能体学习深度融合,帮助读者理解多智能体系统交互与学习的本质,进而领略智能决策之美。

——高阳 南京大学教授

Part.5

写在最后

AI Agent从单智能体工具走向多智能体协作,是技术落地的必然方向。市场数据已经给出了明确的扩张信号,但把博弈论从公式变成可运行的代码,是团队真正跨过门槛的关键一步。

上海交大ACM班20多年的教学经验说明,这门学科最有效的学习路径就是动手写代码、跑实验。窗口期正在打开,现在补上这一环,还来得及。

原文链接:

Agent市场冲向千亿,68%企业却招不到人——中间差了什么?如何把博弈论从公式翻译成可运行代码?https://mp.weixin.qq.com/s/8sSRqEt-Rto8xuFfBl2xqw?scene=1

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐