博弈论基础:战略互动
· · ·
当你的最优选择取决于他人的选择——纳什均衡与战略思维
题目进度 0 / 0 ✓ 0
**预计时间:**25 分钟读 + 15 分钟做习题 = 40 分钟。
本课方法论承诺
读完这节课,你将掌握:① 博弈论的三个基本要素——参与者、策略、收益;② 占优策略 vs 纳什均衡——什么时候"理性选择"导致集体非理性;③ 重复博弈与合作如何产生。
一、核心概念定义
博弈的基本要素
- 参与者(Players):做决策的个体
- 策略(Strategies):每个参与者的行动选择
- 收益(Payoffs):不同策略组合下的结果
占优策略(Dominant Strategy)
策略 s* 是占优策略,如果无论其他参与者选什么,s* 都是最优的。
囚徒困境就是占优策略的例子:无论对方选择什么,“坦白”都是你的最优选择。
纳什均衡(Nash Equilibrium)
策略组合 (s₁*, s₂*, …, sₙ*) 是纳什均衡,如果没有任何参与者有动机单方面偏离。
纳什均衡不一定是最优的——囚徒困境的(坦白,坦白)是纳什均衡,但帕累劣于(沉默,沉默)。
囚徒困境(Prisoner’s Dilemma)
两个囚徒,各自选择”坦白”或”沉默”:
| B 沉默 | B 坦白 | |
|---|---|---|
| A 沉默 | 各 1 年 | A 10 年,B 0 年 |
| A 坦白 | A 0 年,B 10 年 | 各 5 年 |
占优策略是”坦白”,但(坦白,坦白)各 5 年劣于(沉默,沉默)各 1 年。
二、学科直觉
- 个体理性 ≠ 集体理性:囚徒困境的核心悖论。每个人都做对自己最优的选择,结果对所有人更差。这是”市场失灵”的根本原因。
- 纳什均衡是”自我执行的承诺”:在均衡中,每个人都没有动机偏离——不需要外部强制。但纳什均衡可能有多个,或者都不是最优的。
- 重复博弈改变一切:一次性博弈(单次囚徒困境)必然走向(坦白,坦白);重复博弈(多次互动)可以让合作成为均衡——以牙还牙(tit-for-tat)是进化稳定的合作策略。
三、跨学科应用
定价博弈:价格战的逻辑
两家航空公司竞争同一条航线:
- 都高价:各赚 5000 万
- 都低价:各赚 1000 万
- 一家高价一家低价:高价者亏 500 万,低价者赚 8000 万
占优策略是”低价”——但(低价,低价)各赚 1000 万劣于(高价,高价)各赚 5000 万。
为什么现实中有高价? 因为不是一次性博弈——重复互动让”默契高价”成为可能的均衡(以牙还牙策略)。
公共品博弈:搭便车问题
公共品(如国防、清洁空气)的特征:非排他性 + 非竞争性。
- 每个人无论付费与否都能享受
- 但公共品需要资金——如果所有人都等别人付,公共品就不会被提供
搭便车均衡:P < 成本 → 公共品不足。这是政府存在的核心经济学理由。
芒格式提醒
芒格说:"不要参加估值为零的期权游戏。" 在博弈论中,如果你发现自己处于"无论对方选什么,你选 A 都优于选 B"的情况,但 A+B 组合劣于 B+B,你遇到了囚徒困境。这时候最优策略不是"坚持理性",而是改变游戏结构(承诺、重复互动、第三方惩罚)。
练习题
单选题
1
占优策略的定义是?
2
纳什均衡的定义是?
3
囚徒困境中,占优策略均衡是?
4
个体理性与集体理性的冲突在囚徒困境中体现为?
5
重复博弈促进合作的原因是?
6
公共品博弈的核心问题是?
7
改变博弈结构(如引入重复互动)的目的是?
案例分析
C1
C1. 案例:两家公司陷入价格战,都低价导致利润暴跌。博弈论解释?
反事实思考题
T1
T1. 反事实:如果所有博弈都是一次性的(没有重复互动)。对社会的后果?