眼睛会骗你为什么这游戏故意不让你看
人的听觉在时间上的分辨率,比视觉好一个数量级。耳朵能听出两个声音差几毫秒,眼睛看两个闪光差几十毫秒还觉得是同时。
更糟的是,视觉这条通路上还挂着一串你控制不了的延迟:屏幕的、渲染的、动画本身的。
而节奏天国做了一件在音游里很罕见的事 —— 它主动把视觉这根拐杖抽走了。这一章会用一个 demo,把你「只用耳朵」和「只用眼睛」的抖动分别量出来。多数人会看到一个让自己不太舒服的差距。
一个你已经知道的例子
先用一件你肯定经历过的事,把这一章的论点摆出来。
看电影的时候,如果音画不同步,你几乎立刻能察觉 —— 但你察觉的方式很有意思:你不是「看出来」的,是「听出来」的。嘴型和声音对不上的那种不适感,来源是声音这一侧的精确性,画面那一侧其实相当宽容。
再想想另一件事:你能不能在心里稳定地重复一段旋律的节奏?大多数人可以,而且相当准。那么,你能不能在心里稳定地重复一段闪光的节奏?试一下就知道 —— 后者困难得多,也模糊得多。
这两件小事说明了同一件事:时间这个维度,在你的脑子里主要是挂在听觉上的。它不是「也可以用眼睛」,而是「用眼睛会明显更差」。
两只感官,两种精度
耳朵和眼睛处理时间的能力差得很远,而且差的方向很明确。
听觉系统是为时间设计的。声音本来就是一个随时间变化的压力波,你的耳蜗每时每刻都在做时间上的分解。人能分辨出两个咔哒声之间几毫秒的间隔,也能听出一个音源是从左边还是右边来的 —— 后者靠的正是两只耳朵之间几十微秒的时间差。
视觉系统是为空间设计的。它非常擅长回答「那是什么」「在哪里」,但对「什么时候」相当迟钝。两个闪光要拉开几十毫秒,你才会觉得它们不是同时发生的。
回到第 3 章那个积分:命中率由三个数决定,其中「抖动」是你自己贡献的噪声。
而「用眼睛判断时间」这件事,会直接往抖动里灌进去几十毫秒。这不是你不够专心,这是通路本身的分辨率上限。
换句话说:只要你在用眼睛打节奏,你的抖动就有一个练不下去的地板。练到那个地板之后再怎么努力都没用 —— 因为限制你的不是练习量,是你选错了传感器。
屏幕上还挂着一串你控制不了的延迟
就算你的视觉系统足够快,画面到达你眼睛的时刻,也不是游戏「想让它到达」的时刻。中间有一串延迟:
| 环节 | 典型量级 | 你能不能控制 |
|---|---|---|
| 游戏渲染一帧 | 16.7ms 起 | 不能 |
| 显示器 / 电视的图像处理 | 数毫秒 ~ 数十毫秒 | 能(换模式) |
| 面板本身的响应 | 数毫秒 | 不能 |
| 无线音频编解码 | 可达 150–200ms | 能(换有线) |
其中最值得动手的是第二行。很多电视在默认画质模式下会做一堆图像后处理(插帧、降噪、锐化),每一样都要缓冲若干帧。把电视切到「游戏模式」,通常就是关掉这些处理 —— 这一步经常能省下几十毫秒。
而最后一行是本书唯一会直接劝你换设备的一条:做节奏相关的事,别用蓝牙。蓝牙音频的延迟量级比你要处理的东西本身还大 —— 你练一辈子也补不回一个 180ms 的固定偏移,何况它还可能不稳定。
如果你用的是有线设备(耳机插在机器上、或者直接用机器自带的喇叭),那么上面那张表里最大的一项已经跟你无关了。
但别急着放心 —— 剩下的两项还在:屏幕的延迟依然存在,而且掌机和电视模式下的数值可能差很多。
这就是为什么「换了显示方式要重新校准」是一条真规矩,而不是玄学。第 5 章会让你把这件事量出来。
量一下你自己的两条通路
下面这个 demo 有三个回合,每回合 16 拍,只量一件事:你的抖动有多大。
- 只听:有声音,没有可跟随的画面。这是你的基准线。
- 只看:完全没有声音,只有一个小球扫过判定线。
- 视听打架:两者都有,但画面被故意推后了 90ms。
前两回合看抖动那个数。第三回合请特别注意偏移那个数:
如果你的偏移被拖向了正数(变晚了),说明你在跟着画面走 —— 画面晚了 90ms,你也跟着晚。
如果你的偏移基本没动,恭喜,你的身体已经默认信任耳朵了。这是玩这个系列最重要的一项资产。
典型的结果是:只听那一轮的抖动最小;只看那一轮明显更大,很多人会大出一倍;视听打架那一轮抖动不一定最大,但偏移常常被拉走一截。
第三个结果最值得琢磨。它说明的不是「你笨」,而是你的大脑在默默地把两条通路的信息融合起来 —— 这在日常生活里是好事(它让你觉得说话的嘴和声音是同步的),在这里却是灾难:一个被污染的通路,会把干净的那个也一起拖偏。
「同时」不是一个点,是一段区间
第三回合那个结果值得再挖一层,因为它背后有一个相当反直觉的事实:你的大脑并不判断两件事是不是同时发生的,它判断的是「够不够接近,可以当成同一件事」。
这是有道理的。现实世界里,光跑得比声音快得多 —— 十米外拍一下手,画面立刻到你眼睛,声音要晚三十毫秒。如果大脑严格地把它们当成两件事,你会觉得这个世界一直在「音画不同步」。所以大脑的做法是:在一个不小的区间之内,把视觉和听觉强行绑成一件事。
这个整合区间有几十到一百多毫秒宽(具体数值因人、因场景差异很大,这里只取量级)。落在区间里的视听事件,你不但会觉得它们同时,还会觉得它们发生在同一个时刻 —— 而那个时刻往往被声音说了算。
这件事有两个后果,一好一坏。
好的一面:只要画面和声音的偏差在整合区间之内,你根本不会察觉,也不会被干扰。所以你不需要一个零延迟的屏幕。
坏的一面:你也不可能靠意志力把画面这条通路关掉。就算你决定「我只听声音」,视觉信息还是会被融合进来,然后悄悄挪动你以为的那个「时刻」。
所以对付它的办法不是「更专心地听」,而是把眼睛派去做别的事 —— 看场景、看该按哪个键,不要看任何一个正在往判定点移动的东西。
为什么动画特别擅长骗你
还有一层:不是所有画面都同样会骗你。连续运动的画面骗人最狠。
原因在于,你的视觉系统对连续运动会自动做外推 —— 看到一个球匀速飞过来,你不需要等它到达,就能算出它什么时候到。这个能力在接球的时候是救命的,在这里却成了一个假的时间来源:它给你一个自信满满的、但精度只有几十毫秒的答案。
下落式音游正是靠这个能力工作的 —— 那条轨道就是为了让你外推。而节奏天国刻意避开它:
- 它的关键动作大多是突然发生的,不给你外推的过程;
- 或者反过来,给你一个很长的匀速运动,但落点并不在判定时刻上 —— 你外推得很准,只是推到了错的地方。
第二种是最难受的一类,因为你会觉得自己「明明看得很清楚」。看得清楚和算得准是两回事,而外推给你的自信恰恰与它的精度无关。
掌机和电视:同一个你,两个偏移
把上面这些拼起来,可以得到一条很实用的结论。
掌机模式下,屏幕就在机器上,画面链路短,音频走的是机器自己的喇叭或者插着的耳机。电视模式下,画面要经过 HDMI、经过电视的图像处理管线,声音可能走电视喇叭、也可能走别的设备 —— 两条链路的延迟不一样,而且不一定同步地不一样。
同一个人,两种模式
掌机: 画面延迟小 声音延迟小 两者接近
电视: 画面延迟大 声音延迟看设备而定
结果:你在掌机上校准好的那个偏移,
搬到电视上可能整个偏掉几十毫秒。
这不是你的手变了,是链路变了。
所以第 2 章那条「换显示方式要重新体检」的建议,到这里就有了具体的机制。它不是谨慎,它是必要的 —— 因为你要减掉的那个常数,本来就有一大半不属于你。
为什么这个游戏要主动抽掉视觉
现在可以回答第 1 章埋下的那个问题了:节奏天国为什么不给你下落轨道。
因为下落轨道会把玩家推进那条更差的通路。有了轨道,玩家会本能地去看 —— 视觉是人类的主导感官,只要画面上有可追踪的东西,注意力就会往那边跑。而一旦玩家开始用眼睛判断时间,他就被锁在了上面那个抖动地板上。
所以这个系列的做法是:不给你可追踪的画面,或者给你一个会骗你的画面。常见的几种手法:
- 目标从画面外进来。等你看见它的时候,剩下的时间已经不够反应了 —— 但如果你在数拍,你早就知道它什么时候到。
- 动画的视觉重心不在判定点上。角色做一个夸张的大动作,而该出手的那一瞬间画面上什么也没有。
- 关键处直接遮住。有些小游戏干脆把该看的东西挡起来,只留声音。
- 视觉节奏和听觉节奏不一致。画面在做一件事,音乐在做另一件事,跟错了就全崩。
这些看起来像是恶趣味,其实是同一件事的四种写法:逼你把判断依据从眼睛挪到耳朵,再从耳朵挪到你自己心里那个网格。
老玩家中间流传一句话:这个游戏很多关闭着眼睛反而打得更好。
这句话在很大程度上是真的,原因就是这一章的全部内容:闭眼消灭了一条噪声更大的通路,也消灭了「被画面骗走」的可能。
但要说清楚一件事:闭眼不是通关技巧,是一个诊断手段。如果你闭眼打得更好,说明你之前一直在用眼睛;如果闭眼和睁眼差不多,说明你已经不靠画面了 —— 那才是你要的状态,而到了那个状态之后,睁着眼睛玩显然更有意思。
那画面到底该怎么用
说了这么多,并不是让你真的不看。画面在这个游戏里有它不可替代的作用 —— 只是那个作用不在「计时」上。
| 用途 | 该用哪只感官 | 为什么 |
|---|---|---|
| 现在是第几拍 | 耳朵 | 时间分辨率高一个数量级 |
| 这一下该不该出手 | 耳朵 | 音乐的图形本身就是答案 |
| 这一段是什么类型 | 眼睛 | 识别场景是视觉的强项 |
| 要按哪个键 / 哪个方向 | 眼睛 | 空间信息只有视觉给得了 |
| 这是第几遍、要变了没 | 眼睛 | 结构提示常常是视觉的 |
规律很清楚:眼睛回答「什么」和「哪里」,耳朵回答「什么时候」。把这两件事分派对了,你就同时拿到了两只感官各自最强的那一面。
混乱发生在你让眼睛去回答「什么时候」的时候 —— 那是它最不擅长的一件事,而且它还会热心地把答案塞给你,让你以为自己知道。
不要盯着「该出手的那个东西」。改成下面这样:
1. 把视线放虚,看整个画面,不聚焦在任何一处。这样你依然能接收到「场景变了」这种粗粒度的信息,但不会被某个具体动画牵着走。
2. 出手的判断完全交给耳朵。手跟着你心里那个网格走,不跟着屏幕上任何一个运动的物体走。
3. 如果某一关你总是被画面带偏,就先闭眼打两遍,把这一段的听觉图形记住,再睁眼。
这三步做完,你会发现有些「一直过不去」的关卡,难的其实从来不是节奏。
一个必要的补充:不是所有人都能这样分派
上面那张分工表有一个前提:你能听见,而且听得清。
如果你在听力上有困难,或者不得不在嘈杂环境里玩,那么这一章的建议要反过来读 —— 你的最佳通路可能就是视觉,那么该做的事不是「改用耳朵」,而是把视觉这条通路上的可控延迟压到最低:电视切游戏模式、能用掌机就用掌机、关掉一切图像后处理。同时把第 5 章的校准做得更认真一些,因为你要减掉的那个常数会更大。
另外,即使听觉是主通路,也有一类信息只能靠身体:第 18 章会讲到,把拍打在脚上、点在头上,等于给自己造了一条本体感觉的时间通路。那条通路的时间精度介于听觉和视觉之间,但它有一个独门好处 —— 它是你自己发出来的,所以它没有延迟。
接下来
这一章把通路固定下来了:时间的事,交给耳朵。
下一章处理那条通路上剩下的最后一个问题 —— 它上面挂着一个常数。有一部分是设备的(音频输出要走一段路,屏幕要刷新),有一部分是你的(你的身体习惯提前多久出发)。
这两部分加在一起,就是第 2 章量到的那个「偏移」。而它们的共同点是:都可以被一次性减掉,而且减掉之后再也不用管。那是这本书里最便宜的一次收益。
下一章还会做一件这本书里唯一一次「拆开机器给你看」的事:把浏览器自己承认的音频输出延迟读出来。那个数字不是估的,是 Web Audio 这套接口自己报的 —— 你会看到,连一台什么额外设备都没接的电脑,声音从算出来到抵达喇叭,也要走掉可观的一段时间。
本章治的是:抖动的地板,和一个你以为不存在的偏移。用眼睛打节奏会同时抬高抖动、拖走偏移 —— 而且两样你都感觉不到。
带走一句话:眼睛回答「什么」和「哪里」,耳朵回答「什么时候」。