你能改的那一条规则
最后一章不讲新东西。它把前面二十三章压成一张能带走的表,一份能拿去自查的错误直觉清单,以及——如果这本书对你起了作用——接下来该往哪儿走。真正难的从来不是解一个博弈,是认出你正在一个博弈里。
想一件让你反复受挫的事:一个总也推不动的做法、一个所有人都抱怨却没人改的流程、一个你觉得「大家明明都知道该怎么做」的场面。
问:在那件事里,最有可能真正起作用的是哪一类动作?
顺便在心里写下另一个答案:如果只准你改一个数字或者加一条规则,你会改什么?读完这一章的自查表,再回来看看你还改不改这个。
这本书的两句话
上半句:只要桌上还有第二个会算账的人,「最优解」就不存在了;剩下的只有「最优应对」。而所有人的最优应对撞在一起的那一格,未必是任何人想要的地方——它只是没人能靠自己走开。
下半句:既然人人都会走到那一格,那么想改变结果,去劝人是没有用的。你能改的不是别人的选择,是那张收益表。
七个问题
下面这张自查台把二十三章压成了七个问题。它没有算法,它只是一份清单——而清单的价值,在于它能让你在正确的地方开始思考。
那张四种病的表,再看一遍
第 3 章那张表值得再抄一遍,因为它是这本书里最实用的一样东西。认错了病,连解药的种类都是错的。
| 判据:对方已经在合作时,我还想不想背叛? | 这是什么 | 有用的做法 | 没用的做法 |
|---|---|---|---|
| 想(T > R) | 囚徒困境 | 改收益表:罚款、押金、绑定、把一次交易切成很多次 | 沟通、倡议、互信、动员 |
| 不想,但不敢先动(R > T) | 协调问题(猎鹿) | 公开宣布、共同知识、一个所有人都看得见的焦点 | 惩罚(没人想背叛) |
| 不想,但想抢先手(S > P) | 斗鸡 | 协调装置:红绿灯、优先权规则、私下的相关建议 | 比谁更硬(那正是撞车的原因) |
| 根本不想 | 没有困境 | 把信息传到位 | 设计任何机制 |
二十四条错误的直觉
每一章都有一条「✗ 这个直觉是错的」。收在一起是这样:
| 章 | 这个直觉 | 问题在哪 |
|---|---|---|
| 01 | 博弈论是教人算计别人的 | 它最常见的结论是「所有人都很聪明,结果所有人都更惨」 |
| 02 | 混合策略就是「随便出」 | 它是算出来的确定打法,只不过输出是一组频率 |
| 03 | 囚徒困境说明人自私 | 把利他折算进收益表,只要四个数的顺序不变,困境原封不动 |
| 04 | 多给一个选项不会让事情变差 | 选项改变的是均衡的位置,而均衡是所有人共同落脚的地方 |
| 05 | 提高代价就能减少某种行为 | 只在对手不会调整时成立。会调整的话,你加的压力会被他的松懈吃掉 |
| 06 | 均衡是最优策略 | 均衡是大家摸清彼此之后的落点,不是此刻的落点 |
| 07 | 大家都知道的事,再说一遍是浪费 | 「都知道」和「都知道大家都知道」是两种状态 |
| 08 | 先出手的人有优势 | 取决于信息往哪个方向流 |
| 09 | 只要还有下一次,人们就会合作 | 「还有下一次」是一个量,必须跨过一个具体的门槛 |
| 10 | 不吃亏是底线 | 「不吃亏」是相对量,「拿得多」是绝对量,两者常常方向相反 |
| 11 | 加强监管就是抓得更严 | 抓得严只是四个旋钮之一,而且常常不是最便宜的那个 |
| 12 | 博弈论假设人是理性的 | 均衡不需要理性,只需要淘汰 |
| 13 | 设计规则就是写进规定加处罚 | 好机制的标志是:你走开之后它照样成立 |
| 14 | 第二价格对卖家不利 | 只看了「付多少」,没看「报多少」 |
| 15 | 更聪明的规则能榨出更多的钱 | 能改变收入的只有人数、保留价、以及某条前提被打破 |
| 16 | 用了理论上更差的机制就是设计失误 | 通常说明有一条不在模型里的约束在起作用 |
| 17 | 算法一视同仁,结果就公平 | 不歧视个体,不代表不偏袒角色 |
| 18 | 要教育大家诚实填报 | 在不是策略防伪的机制里,号召诚实等于号召吃亏 |
| 19 | 得票最多的就是大家最想要的 | 「大家最想要的那个」可能根本没有定义 |
| 20 | 人多力量大 | 公共品问题里,人数在分母上 |
| 21 | 机器要玩好博弈得先理解博弈 | 均衡可以是局部调整的副产品 |
| 22 | 要协调就得公开所有信息 | 冲突的局里,让每个人知道少一点反而更好 |
| 23 | 找一个更好的指标就行 | 任何指标一旦绑上激励,都会开始脱钩 |
| 24 | 「大家讲讲道理就好了」 | 讲道理改不了收益表,而人们回应的是收益表 |
最后一条,也是最难的一条
这本书从头到尾在教一种冷静的看法:不问动机,问结构;不劝人,改表。这个视角很有力,也有它的代价,需要在结尾说清楚。
第一,收益表不是给定的。这本书里的每一张表都是我写好递给你的。现实里没有人递给你表——你得自己估计,而估计常常是错的。而且人们在意的东西比模型里多得多:公平、面子、被看见、不想当那个先低头的人。第 8 章那个最后通牒实验已经说明了这一点:把「公平感」漏出收益表,模型的预测就完全不对。
第二,「均衡」这个词很容易被滥用。说「这是个囚徒困境」比证明它是要容易一万倍。这本书给了你一个判据(对方已经在合作时,我还想不想背叛),请真的去用它——大多数被称作「囚徒困境」的东西其实是协调问题,而协调问题便宜得多。
第三,会改表的人也可能改错方向。机制设计的力量是中性的:同一套工具可以用来让合作变得可能,也可以用来把别人锁进一个不利的均衡。这本书不能替你决定往哪边用。它只能保证一件事:你会更难被别人设计的机制悄悄摆布——因为你现在会问「这条规则让谁的最优应对变成了什么」。
继续往下走
如果这本书对你起了作用,下面是几条真的能走下去的路。
如果你想把数学补扎实
- Osborne & Rubinstein,《A Course in Game Theory》(1994)。标准的研究生教材,简洁、严格,可以免费获取。想真正读懂定理证明的话从这本开始。
- Osborne,《An Introduction to Game Theory》(2003)。同一位作者的本科版本,例子多得多,是这本小书的自然下一步。
- Fudenberg & Tirole,《Game Theory》(1991)。厚,全,当工具书查。
如果你对机制设计和市场感兴趣
- Alvin Roth,《Who Gets What — and Why》(2015)。这本书讲的正是本书卷 V 那些东西:住院医师配对、择校、肾脏交换。作者本人就是设计者,写得非常好读。
- Paul Milgrom,《Putting Auction Theory to Work》(2004)。频谱拍卖的实战。它会告诉你第 15 章那些「定理失效的条件」在现实里有多重要。
- Elinor Ostrom,《Governing the Commons》(1990)。第 20 章那位。它是对「公共资源必然被耗尽」这个结论最有力的反驳,而且全部基于田野证据。
如果你想动手写代码
- 把 CFR 写一遍。从库恩扑克开始(三张牌,一轮下注,一两百行就够),跑出 −1/18 来。这是最能建立信心的一个项目,而且做完之后 Libratus 那类系统对你就不再是黑箱。之后可以扩到 Leduc 扑克。
- 写一个 Axelrod 式的锦标赛。Python 有一个成熟的开源库叫
Axelrod,收录了几百个策略,可以直接开跑。或者自己写一版,试试加噪声、加演化淘汰。 - 写一个稳定匹配求解器,然后穷举全部稳定匹配,亲眼看看两侧最优是怎么成为这个集合的两个极端的。
- 把这本书的引擎读一遍。它就在
public/regret/assets/engine.js,两千多行,零依赖。里面有精确有理数的单纯形、支撑枚举、CFR、Wardrop 均衡求解器。
还在争论的地方
下面这几件事没有定论,如果你要往深处走,它们是有意思的地方:
- 纳什均衡到底是不是正确的解概念。它难算(PPAD-完全)、常常不唯一、在真人身上预测不准。第 22 章提到有人主张相关均衡更该当默认。也有一整支文献主张应该看学习过程的收敛点,而不是静态的不动点。
- 行为博弈论与标准理论的关系。人们在实验里系统性地偏离均衡预测(最后通牒、蜈蚣、选美竞赛都是)。这些偏离是「噪声」还是「模型缺了变量」,是一个持续的争论。Colin Camerer 的《Behavioral Game Theory》(2003)是这一支的入口。
- 演化博弈论能解释多少人类合作。亲缘选择、互惠、群体选择、文化演化——哪一个占主导,在生物学和人类学里争了几十年,至今没停。
- 机制设计在算法时代的边界。当参与者是会学习的算法而不是人时,很多经典结论需要重新审视(第 21 章末尾那条「换你定规则」正是在说这个)。这是一个很新、很活跃的方向。
如果你想接着往书架上走
- 《撞墙》(排队与拥塞)——第 4 章那条路上的车为什么会越来越慢,那本书讲得比这本细得多。两本合起来才是完整的拥塞图景。
- 《打分》(强化学习)——第 12 章和第 21 章的另一半。那本书里一个智能体被 reward 塑形,这本书里一群人被彼此塑形。
- 《拨动》(因果推断)——这本书里所有的「改一条规则会怎样」,本质上都是干预问题。想认真回答「这条规则真的起作用了吗」,需要那本书的工具。
- 《意外》(信息论)——第 7 章那句「公开不是为了让人知道,是为了让人知道别人知道」,和那本书的「信息 = 意外」放在一起读会很有意思。
- 《过冲》(反馈控制)——第 23 章那个「你看到的是代理」,和那本书的「你看到的是过去」,是同一类失控的两种成因。
- 《上链》(Web3)——第 23 章的 MEV 在那本书里有完整的技术背景。
最后给一个可以明天就用的动作。
下次你遇到一个「所有人都知道该怎么做,但没人这么做」的场面时,不要先问「为什么大家不配合」。先画一张两行两列的表,把你和另一方各自的两个选择填上,再填四对数字。
然后划线:每一列里,找出对我最好的那格,画一道横杠;每一行里,找出对他最好的那格,画一道竖杠。
看两道杠落在哪。
如果它落在你不想要的那一格,你至少知道了三件事:这不是态度问题;那些数字里有一个需要动;以及,动哪一个是可以算出来的。
「大家讲讲道理就好了。把利害关系说清楚,人自然会做正确的事。」
这是这本书从第 1 章反对到第 24 章的那一条,也是最难放下的一条——因为它在协调问题里是对的,而协调问题恰好是最常见、也最容易被解决的那一类。于是它给人留下了「讲道理管用」的印象。
但在囚徒困境里,讲道理不管用,而且失败的方式很隐蔽:所有人都会点头同意,然后回到工位上继续做原来的事——因为他们的最优应对一个字都没变。你会误以为是执行力问题,于是讲第二遍。
判据还是那一句:对方已经在合作了,我还想不想背叛?想,就别开会了,去改那张表。
正确答案是 C:先判断是哪一类局。
A 「讲透道理」——在协调问题(猎鹿)里它非常有效,而且便宜;在囚徒困境里它一点用都没有。用错地方的代价不只是白费力气,还会让人误判成「态度问题」。 B 「加大问责」——第 5 章已经算过这笔账了:如果执法者会根据违规率调整自己的力度,你加的那份压力会被他的松懈吃掉,违规率纹丝不动。而且在协调问题里,惩罚是完全多余的——没人想背叛,只是没人敢先动。 D 「换个人来负责」——这是把结构问题当成了人的问题。第 12 章那一整章就是在说:均衡不需要特定的人。换掉一个人,新来的人面对同一张表,会做出同样的最优应对。至于第二个问题(你会改什么),没有标准答案。但有一个判据可以拿来检验你写下的那个改动:
把你自己从这个方案里拿掉,它还成立吗?
如果你的改动需要你一直在场盯着、需要你反复提醒、需要某个人保持高尚——那它是一条规定,不是一条机制。它会在你转身之后失效。
而如果它改的是那张表上的一个数字,让你想要的那个结果变成了每个人自己的最优应对,那它就能在你走开之后自己运转下去。
第 13 章那个一人切一人挑,全部的美就在这里:你可以走开。
最后一次。这一次没有例子,只有一个格式:
我手上这件事现在是这样的:______。每个人的最优应对是______,所以它停在了______。 如果把______改成______,最优应对会变成______,它会停在______。能把这两行填满,这本书的目的就达到了。
这一章的一句话
你算不出最优解,因为最优解不由你一个人决定;能由你决定的,是这张表。