ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

博弈树建模与倒推法:动态博弈中的序贯决策实战指南

博弈树建模与倒推法:动态博弈中的序贯决策实战指南 简介本资源是《博弈论教程第三版》第四章配套教学PPT聚焦序贯决策博弈核心内容面向高校经济学、管理学及应用数学专业师生以及对动态博弈建模有需求的研究者与从业者。课件系统讲解博弈树构建、策略与行动区分、序贯博弈纳什均衡求解、倒推法后向归纳实操步骤并结合房地产开发、进入障碍等典型案例展开分析涵盖扩展式表述、信息集定义、支付向量排序规则等关键要素助力读者掌握动态博弈的建模逻辑与分析工具。资源为单个PPT文件共1个大小399KB轻量易读适合作为课堂讲授辅助或自学精要材料。目前已有78人学习下载内容结构清晰、理论严谨、图示丰富特别适合初学博弈论动态模型的学习者快速建立序贯决策思维框架。1. 这份PPT不是讲“怎么画树”而是教你怎么在动态博弈里抢到决策先机你手头这份《博弈论教程第三版》第四章PPT表面看是高校课程配套幻灯片实际是一套可直接拆解、可现场推演的序贯决策建模工具包。它不讲抽象公理而是用房地产开发、进入障碍博弈、男女协调博弈三个真实场景把“谁先动、谁后应、谁被信息卡住、谁靠倒推赢”全钉在博弈树的节点和棱上。新手能照着PPT第12页的树形图5分钟内画出A企业先行、自然选市场、B企业后动的三层结构有5年经验的策略分析师会重点抠第28页“垄断者四个纯策略”的行动集映射逻辑——{抵抗容忍}和{容忍抵抗}看似对称但对应的信息集完全不同直接影响纳什均衡的稳定性。它适合三类人教博弈论的讲师需要可演示的树形动画脚本产品/战略岗要设计用户路径或竞对响应机制咨询顾问做行业进入壁垒分析时直接调用PPT第35页的支付向量模板填空。这不是理论复述是把“动态性”从黑箱里拽出来摊在桌面上算。2. 博弈树不是示意图是必须满足7个结构约束的数学对象2.1 为什么必须用博弈树而非收益矩阵描述序贯博弈战略式表达即收益矩阵隐含一个致命假设所有参与者同时、一次性选择完整策略。但现实中A房企拍下地块后B房企才决定是否跟进垄断者看到新玩家入场才启动价格战。此时行动顺序本身成为策略变量。PPT第4页明确指出“扩展式表述要体现参与人的行动顺序、信息集、外生事件概率分布”——这三点矩阵根本无法承载。例如房地产案例中“自然选择市场需求大小”这个外生节点其1/2概率必须附着在分支棱上而矩阵只能给定静态结果。更关键的是信息集B企业决策时知道A已行动、但不知道自然选择结果即不知道当前处于“需求大”还是“需求小”子树这种不完美信息必须用虚线连接相同信息集的决策节点矩阵对此完全失语。提示PPT第15页的博弈树图中B企业的两个决策节点被虚线框连这就是信息集的可视化标记。漏画这条虚线整个模型就默认B拥有完美信息后续倒推结果必然错误。2.2 构建合法博弈树的7条硬性规则PPT第8-9页隐含了博弈树的公理化定义我们将其提炼为可验证的7条结构约束任何违反即为无效模型规则编号约束内容违反后果PPT对应页码R1每个非末端节点有且仅有一个归属参与者节点责任不清无法定义最优反应第7页“决策节点与局中人对应”R2末端节点必须绑定n维支付向量维度参与人数量收益不可比纳什均衡无定义第10页“支付向量按首次行动顺序排列”R3除根节点外每个节点有且仅有一条入棱确保历史路径唯一避免时间悖论第9页“唯一棱指向”说明R4同一信息集内所有决策节点其可选行动集必须完全相同保证信息对称性否则后向归纳失效第16页B企业两节点行动集均为{进入,不进入}R5从任一决策节点出发的出棱数 ≥1且无上限允许“无操作”策略但禁止悬空节点第9页“至少一条棱延伸”R6外生事件节点如“自然”必须标注概率分布风险决策失去依据期望收益计算崩溃第13页“市场需求大1/2”标注R7不存在环路即无节点可通过棱序列回到自身保证博弈有限终止倒推法有起点第8页“树”的图论定义2.3 房地产开发案例的树形重建实操以PPT第13页房地产案例为例手动验证R1-R7并重建树结构# 步骤1确定参与人及顺序满足R1,R3 # A(房企) → 自然(外生) → B(房企) # 根节点A的决策节点R1归属A # 步骤2添加自然节点满足R6 # A节点分两枝[开发]、[不开发] # [开发]后接自然节点分两枝[需求大, p0.5]、[需求小, p0.5]R6 # 步骤3添加B节点满足R1,R4 # [需求大]后接B节点行动集{进入,不进入} # [需求小]后接B节点行动集{进入,不进入}R4行动集一致 # 步骤4添加末端节点满足R2,R5 # B每个行动后接末端节点共4个末端 # (A开发,需求大,B进入) → 支付向量(π_A, π_B) (3,1) # (A开发,需求大,B不进入) → (5,0) # (A开发,需求小,B进入) → (1,-2) # (A开发,需求小,B不进入) → (4,0) # 注意所有向量为2维R2且A在前首次行动者 # 步骤5检查R7无环路 # 路径A→自然→B→末端单向流动无回边R7满足参数说明p0.5是外生概率必须显式标注R6不能省略或写成“等可能”B的两个决策节点用虚线连接PPT第15页表明B不知道需求大小信息集相同这是R4成立的前提若误将B的行动集设为{进入}和{不进入}即不同则R4被破坏倒推时无法统一比较B的期望收益。3. 倒推法不是“从后往前算”而是对每个信息集求解子博弈精炼均衡3.1 为什么纳什均衡在序贯博弈中会失效PPT第22页的男女协调博弈直击要害若男方选足球、女方选芭蕾双方收益(2,1)但若男方选芭蕾、女方选足球收益(1,2)。此时(足球,芭蕾)和(芭蕾,足球)都是纳什均衡——因为任一方单方面改策略都会降收益。但问题在于如果男方先动他绝不会选芭蕾因为知道女方会追随选芭蕾导致收益(0,0)。纳什均衡未考虑“动态承诺能力”它允许不可置信的威胁如女方说“你选足球我就选足球”但男方选足球时她选足球反而得0该威胁不可信。PPT第23页点明“序贯博弈的纳什均衡需剔除不可置信的威胁”。3.2 倒推法的四步机械执行流程PPT第25页“倒推法”步骤需严格按序执行每步对应一个数学操作3.2.1 步骤1定位所有末端节点的直接父节点扫描博弈树找出所有“下一步即为末端节点”的决策节点。在房地产案例中B的两个决策节点需求大/小下是直接父节点。关键动作对每个此类节点列出其所有出棱对应的末端支付向量。3.2.2 步骤2对每个直接父节点计算其最优行动对B在“需求大”节点比较(进入→π_B1) vs (不进入→π_B0)选进入收益更高对B在“需求小”节点比较(进入→π_B-2) vs (不进入→π_B0)选不进入注意此处用的是实际收益非期望值因信息集已知需求状态。3.2.3 步骤3用最优行动替换子树生成简化树将B的两个决策节点分别替换为“需求大”分支 → 末端节点(3,1)“需求小”分支 → 末端节点(4,0)此时A面对的新选择[开发] → 期望收益 0.5×3 0.5×4 3.5[不开发] → 收益0。核心逻辑子博弈精炼要求每个信息集内的决策必须是最优的替换后A的决策基于B的理性反应。3.2.4 步骤4向上迭代至根节点输出完整策略组合A选[开发]3.5 0最终策略组合A开发B{需求大→进入, 需求小→不进入}此即子博弈精炼纳什均衡SPNEPPT第26页称之为“序贯博弈的合理均衡”。注意若跳过步骤3直接让A计算期望值如误用0.5×(3,1)0.5×(1,-2)则犯了混淆信息集的错误——B在需求小状态下绝不会选进入该路径概率为0。3.3 垄断者策略集的穷举验证表PPT第19页列出垄断者的4个纯策略但未验证其均衡属性。我们用倒推法补全垄断者策略表达形式进入者最优反应均衡路径是否SPNE理由S1总容忍{容忍,容忍}进入因进入得1 不进入得0进入→容忍→(5,1)否垄断者在“不进入”分支本可选抵抗获40威胁不可信S2总抵抗{抵抗,抵抗}不进入因进入亏2不进入→抵抗→(4,0)是“不进入”时抵抗得4“进入”时抵抗得2均优于容忍5或5无改进动机S3进抗不忍{抵抗,容忍}进入因进入得2 不进入得0进入→抵抗→(2,2)否“不进入”分支容忍得0但抵抗可得4故S3在该信息集非最优S4进忍不抗{容忍,抵抗}不进入因进入亏2不进入→抵抗→(4,0)是“不进入”时抵抗得4“进入”时容忍得5均无单方改进空间结论仅S2和S4是SPNE印证PPT第27页“先动优势需结合可信承诺”的论断——S2中垄断者通过“总抵抗”建立可信威慑使进入者放弃行动。4. 先动优势的量化陷阱别只看谁先走要看谁控制信息流4.1 先动优势≠先行动者收益更高PPT第31页“先动优势与后动优势”常被误解为“A先动所以A赚更多”。实则关键在信息控制权。以进入障碍博弈为例若垄断者承诺“无论你进不进我必抵抗”S2策略则先动者进入者收益为0后动者垄断者收益为4但若垄断者无法承诺即S1策略则进入者收益为1垄断者收益为5。此时后动者通过可信承诺逆转了优势。PPT第32页强调“先动优势的成立依赖于后动者无法做出可信的、改变先动者预期的承诺”。4.2 用支付向量差分法识别真实优势判断谁具优势不能比绝对收益而要看策略改变带来的边际收益变化。定义先动者优势值 max_{a1} [u1(a1, BR2(a1)) - u1(BR1, BR2(BR1))]后动者优势值 max_{a2} [u2(BR1(a2), a2) - u2(BR1, BR2(BR1))]其中BR表示最优反应(BR1, BR2(BR1))是SPNE结果。对房地产案例SPNEA开发, B:{大→进,小→不进}u13.5, u20.5×1 0.5×0 0.5若A改为不开发u10, u20 → A损失3.5B无变化若B改变策略如全进u20.5×10.5×(-2) -0.5 → B损失1.0先动者优势值 3.5 - 0 3.5A不行动则收益归零后动者优势值 0.5 - 0 0.5B不行动则收益归零→ 先动者优势显著因其行动创造了全部博弈价值。4.3 在PPT中快速定位优势来源的3个锚点翻阅这份PPT时用以下三处快速诊断优势归属看信息集虚线PPT第15、20页若后动者信息集被虚线覆盖多个节点说明其利用先动者行动推断状态优势倾向后动者看外生事件位置PPT第13页若外生节点紧邻先动者如A行动→自然→B则先动者承担更大不确定性优势减弱看支付向量梯度PPT第26页表格计算同一参与者在不同末端节点的收益差差值越大说明其行动对结果越敏感优势越强。例如垄断者在(进,抗)得2、(不进,抗)得4差值2而进入者在(进,抗)得-2、(不进,抗)得0差值2——但前者控制权在垄断者故其优势更稳固。提示PPT第34页“博弈论给自己出难题”实则是提醒当模型中出现“自然”节点概率模糊、或信息集定义不清时先动/后动优势的计算即失效。此时应回退到R6外生事件概率必须明确和R4信息集内行动集必须一致自查。本文还有配套的精品资源点击获取
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进