不用聪明,只要活下来
前面十一章里,人们都在算账。可自然界里没有人在算账:细菌不解方程,基因不做逆向归纳,一棵树不会考虑邻居的最优应对。它们照样精确地落到均衡上。这一章把「理性」这个假设整个拿掉,看看还剩下什么——结果是几乎什么都还在。这件事比它看起来重要得多,因为它意味着博弈论适用的范围,远远超出「会思考的人」。
一个族群里的个体为了资源相遇。每次相遇,一个个体可以表现得好斗(鹰)或者退让(鸽)。
- 鹰遇鸽:鹰拿走全部资源 V,鸽走人,什么也没有;
- 鸽遇鸽:平分资源,各得 V/2;
- 鹰遇鹰:打一架,平均看两边各得 (V − C)/2,其中 C 是打架的代价。
设资源 V = 2,打架代价 C = 6(打一架很疼)。族群里没有人在做选择——好斗与否是天生的,谁的收益高谁的后代就多。
问:几百代之后,好斗者占族群的比例会稳定在多少?
把「选择」换成「繁殖」
之前每一章的推理都长这样:「我算了一下,这么做对我最好,所以我这么做。」现在换一个完全不同的机制:
族群里每种类型占一定比例。每个个体随机遇到别人,按类型拿到收益。收益高的类型,下一代占比上升;收益低的,占比下降。没有人做任何决定。
这个规则叫复制者动态(replicator dynamics),写出来就一行:某类型的增长率 = 它的收益 − 全族群的平均收益。比平均好就涨,比平均差就跌。
请注意这里面完全没有「最优应对」这个概念。没有谁在盘算谁。可是接下来会发生一件很惊人的事。
好斗者的比例
把鹰鸽的收益写成表(V = 2,C = 6):
对方:鹰 对方:鸽 我:鹰 (V−C)/2 = −2 V = 2 我:鸽 0 V/2 = 1
划线看一眼:如果对方是鹰,我当鸽(0)好过当鹰(−2);如果对方是鸽,我当鹰(2)好过当鸽(1)。四道杠又转起圈来——没有纯策略均衡。
混合均衡在哪?按第 2 章的办法,让对方无所谓:
# 记鹰的比例为 x。 # 当鹰的期望收益 = x·(−2) + (1−x)·2 = 2 − 4x # 当鸽的期望收益 = x·0 + (1−x)·1 = 1 − x # 相等 ⇒ 2 − 4x = 1 − x ⇒ 3x = 1 ⇒ x = 1/3 ★ 好斗者的比例 = 1/3,而且这个数正好等于 V/C = 2/6。
现在跑复制者动态:不管从哪个比例出发(1% 的鹰、90% 的鹰都行),族群都会收敛到 1/3。上面 demo 里的引擎会把这些轨迹画给你看。
没有任何一只动物计算过这个数。它是被淘汰出来的。
那个公式在说什么
好斗者的比例是 V/C:资源价值除以打架代价。
请体会一下这个式子的荒谬之处:决定「有多少个体好斗」的,不是好斗能拿到多少(V 在分子上没错,但它同时也决定了退让的收益),而是打一架有多疼(C)。
把 C 调小——比如某个物种的角变得不那么致命——好斗者的比例立刻上升。把 C 调大,好斗者比例下降。而这一切与「个体有多想要资源」关系不大。
这和第 5 章那条铁律是同一件事的两个面孔。第 5 章说:你的行为频率由对手的收益决定。这里说:某类型的比例由相遇时的后果决定。都是同一句话:在有互动的系统里,一个量的决定因素常常不在它自己身上。
生物学家 John Maynard Smith 和 George Price 在 1973 年提出了演化稳定策略(ESS)这个概念:一种类型,如果整个族群都是它,那么任何一小撮变异体入侵进来都活不下去。
ESS 和纳什均衡的关系很紧:每个 ESS 都是纳什均衡,但不是每个纳什均衡都是 ESS。ESS 多要求了一条「抗入侵」,所以它是一个更严格的筛子。
这个概念的历史意义在于:它是从生物学这一侧独立长出来的。梅纳德·史密斯当时并不是在应用经济学,他是在解释动物为什么不把同类打死。两条完全不同的路撞进了同一套数学——这通常说明这套数学抓到了某种真东西。
不收敛的那一种:石头剪刀布
不是所有演化都会稳下来。把石头剪刀布交给复制者动态:石头多了,布就吃香;布多了,剪刀就吃香;剪刀多了,石头又吃香。
结果是族群永远绕着中心 (1/3, 1/3, 1/3) 转圈,一次都不落进去。
这里有一个很好的数值检验。理论上,标准石头剪刀布的复制者动态有一个守恒量:三个比例的乘积 x·y·z 沿着轨道恒定不变。上面 demo 里的引擎用四阶龙格库塔积分了两万步:
起始 x·y·z 0.030000000 两万步后 0.030000000 ✓ 九位数字一个没变。 # 说明画出来的那些圈是真的闭合轨道,不是积分误差凑出来的。
这种「不收敛但也不发散」的行为在自然界真的能观察到。加州有一种侧斑鬣蜥(Uta stansburiana),雄性有三种喉部颜色,对应三种交配策略,它们之间正好构成石头剪刀布的克制关系。Sinervo 和 Lively 在 1996 年发表在《自然》上的观察显示,这三种类型的比例在野外以大约六年为周期循环——不是趋于稳定,是转圈。
为什么这一章对非生物学的人也重要
因为它把博弈论的适用范围从「会算账的人」扩大到了「会被淘汰的任何东西」。
- 市场里的公司。没有一家公司在解均衡,但赚钱的做法会被模仿、亏钱的做法会消失。这个过程和复制者动态是同一个形状。
- 代码库里的模式。好用的写法被复制粘贴,难用的被重构掉。没人在做全局优化,可最后仓库里活下来的那些模式,往往就落在某个均衡上。
- 社交平台上的内容形式。什么样的标题活下来、什么样的视频长度活下来,是被点击率筛出来的,不是被设计出来的。
- 抗生素与耐药性。细菌不思考,但耐药基因的比例严格按照收益差在变化。第 20 章会回到这个例子。
这也带来一条很实用的推断:如果你想预测一个系统的长期形态,你不需要知道参与者有多聪明,你只需要知道什么样的行为会被复制。
抗生素耐药性。细菌不会算账,但耐药基因的比例严格按照收益差在变化:有抗生素压力时耐药株收益高、比例上升;没有压力时耐药通常带一点代谢负担、比例回落。这解释了一件反直觉的事——「间歇用药」在某些情形下比「一直用」更能压住耐药,因为它让那个代谢负担有机会起作用。这是复制者动态的直接推论,不需要任何关于细菌「策略」的假设。
为什么「最佳实践」会自己扩散,也会自己僵化。一个团队里,省事的写法被复制粘贴,麻烦的写法被重构掉。没人在做全局优化,可几个月后仓库里活下来的那些模式,往往就停在某个均衡上——包括那些其实不好、但「一旦大家都这么写就没人愿意单独改」的模式。这正是第 3 章猎鹿的形状,而它的解药也一样:一个公开的、所有人同时看见的决定。
平台上的内容形式。什么样的标题、什么样的时长、什么样的开头三秒能活下来,是被点击率筛出来的,不是被谁设计出来的。所以想改变创作者的行为,去开会呼吁没有用——改推荐算法的收益表才有用。这是第 13 章的预告。
《打分》里有一句招牌:同一台物理引擎,只改 reward,训出四种完全不同的生物——有的走 9.47 米,有的当场趴下刷姿态分。那本书讲的是一个智能体被打分函数塑形。
这一章讲的是一群个体被彼此塑形:没有外部的打分函数,收益是相互给出的。强化学习里对应的名字叫多智能体学习,而它最棘手的地方正是这一章的最后一节——目标本身在动,所以可能永远不收敛,只是转圈。
「博弈论假设人是完全理性的。现实里人没那么聪明,所以它用处有限。」
这是对这门学问最常见的一条批评,而这一章就是对它的回应:均衡不需要理性,只需要淘汰。
复制者动态里的个体没有任何认知能力,可它们照样收敛到纳什均衡(更准确地说:复制者动态的稳定不动点一定是纳什均衡)。这条结果通常被叫做演化博弈论的「理性替代」——它把「大家都很会算」换成了一个弱得多的前提:「做得好的会被复制」。
所以正确的说法不是「博弈论假设人理性」,而是:博弈论描述的是一个系统被反复筛选之后会停在哪里。参与者是人、是公司、是细菌、还是一段代码,都不重要。
正确答案是 B:好斗者的比例稳定在 1/3,也就是 V/C = 2/6。
A 「打架代价大,好斗会被淘汰干净」——这个推理漏掉了一件事:好斗者的收益取决于它遇到谁。如果族群里全是鸽,一只鹰会横扫全场(每次拿 2,别人只拿 1)。所以鹰永远不可能被清零——它只会被压到一个「多了就吃亏、少了就占便宜」的比例上。 C 「接近 1/2」——直觉上觉得两种类型该势均力敌。但均衡比例是 V/C,跟对称性无关。把 C 调到 3,比例就变成 2/3;调到 100,比例就变成 2%。 D 「一直震荡」——这个答案在鹰鸽里错了,但它抓到了一件真事:有些博弈的演化确实不收敛。石头剪刀布就是,而且它转起来的圈精确到九位数字都闭合。判据是:只有两种类型时通常会收敛;三种以上、且存在循环克制关系时,才可能永远转圈。你想减少族群里的暴力(把鹰的比例从 1/3 压到 1/10),能动的只有一个参数。动哪个?
V = 2,C = 6 ⇒ 鹰的比例 = V/C = 1/3。想靠「降低资源的吸引力」来解决?V 降到 1,比例变成 1/6;V 降到 0,就没有博弈了。 把打架代价 C 从 6 提到 20 ⇒ 比例 = 2/20 = 1/10。达标。换成人话:让冲突的后果更严重,比让争夺的东西更不值钱,更有效。但请一定注意第 5 章那条警告——这条结论成立的前提是「后果是自动发生的」(比如角真的更致命)。如果后果要靠某个会偷懒的执法者来施加,那么第 5 章那笔账就会重新接管一切。这两章合起来才是完整的答案。
这一章的一句话
均衡不需要有人去算它,只需要有东西被淘汰;所以这套数学管的不是「聪明人」,而是任何一个「做得好的会被复制」的系统。
卷 III 到此结束。你已经看完了这本书的上半场:怎么读一张表。下半场换一个位置坐——从桌边挪到桌子的另一头,从「我该怎么出手」改问「这张表该怎么写」。下一章开始,母题会翻转过来:横杠竖杠不再是你要找的东西,而是你要挪动的东西。剧透一个数:一张标准的囚徒困境,只要把「背叛得手」从 5 压到 2,两道杠就会一起挪到「一起合作」那一格,两人合计从 2 分变成 6 分——而这中间没有讲过一句道理。