卷 IV · 拆CH 16深度 16/24

逆活用:反过来跑那台机器

前面十五章教的是「怎么造出各种形」。但你看生肉时从来不需要造——你需要的是相反的方向:拿到一个形,找出它的辞书形,因为只有辞书形能查词典。

★★ 真逆活用引擎多解Yomitan 的原理

一个具体的困境

你在漫画里看到这句:

もう帰らなきゃ
もうかえらなきゃ
我该走了

你不认识 帰らなきゃ。于是你去查词典。

查不到。因为词典里没有 帰らなきゃ 这个词条——词典只收辞书形

你必须先自己推回去:

帰らなきゃ
  ↓  なきゃ 是 なければ 的口语缩约
帰らなければ
  ↓  なければ 来自 ない
帰らない
  ↓  ら 在あ段 → 滑回う段是「る」
帰る          ✓ 词典里有:回去

三步。而且每一步都要求你知道对应的规则。

◆ 这就是「读日语」和「读英语」最大的成本差

英语里 went 查不到,你查 go——但大多数英语词的变形只有几种(-s、-ed、-ing),而且词干几乎不变。

日语不同:一个动词能变出十几种形,还能叠加(第 14 章),而且词尾变化会吃掉词干的最后一个假名(五段的滑动)。

所以「查词」这个动作在日语里的成本,比在英语里高一个数量级。

而这个成本,正是「日语看不下去」的最主要的现实原因——不是因为难,是因为每查一个词要三步,一页有三十个生词,你就得做九十步。

这一章要做的,就是把这九十步交给机器。

逆活用的原理:把规则倒过来跑

第 14 章说过:贴的顺序是固定的(使役→受身→否定→过去→敬体)。那么剥的顺序就是它的逆序:从最外层往里剥。

每一步做的事很机械:

看词尾匹配哪条规则  →  按规则改写  →  查词典
                          查不到就继续剥

比如规则表里有这么几条:

なかった  →  ない            (过去否定 → 否定)
ない      →  一段:词干 + る
              五段:あ段 → う段
られる    →  る               (受身/可能,一段)
させる    →  る               (使役,一段)
た / て   →  逆音便(★ 多解,见下)
なきゃ    →  なければ         (口语缩约)

食べさせられなかった 跑一遍:

食べさせられなかった
  ↓ なかった → ない
食べさせられない
  ↓ ない → る(一段)
食べさせられる
  ↓ られる → る(受身)
食べさせる
  ↓ させる → る(使役)
食べる        ✓ 词典里有

四步,全部机械。这台机器可以真的写出来——下面就是。

▶ 动手 · 真逆活用引擎

粘任何一个变形后的词进去。它会一层层扒开,每一步告诉你用了哪条规则

先试预设的 食べさせられなかった,看那四步。

然后试 読んでる——注意它给了不止一个结果。那不是 bug,下面解释。

再试 よかった(形容词)、来い(不规则)、帰らなきゃ(口语缩约)。

上面那几个预设,引擎给出的结果是:

食べさせられなかった  →  食べる    4 步(否定过去 → 否定 → 受身 → 使役)
読んでる              →  読む      2 步(口语 てる → て形 → ★ 逆音便)
来い                  →  来る      1 步(カ変命令形,规则推不出来,只能列表)
帰らなきゃ            →  帰る      3 步(なきゃ → なければ → ない → 五段滑回う段)
よかった              →  いい      1 步(★ 形容词,而且是那个唯一的不规则)
言っちゃった          →  言う      3 步(ちゃった → てしまった → て形 → 逆音便)

注意 来い 那一行:它不是靠规则推出来的。カ変动词「汉字不变、读音全变」,规则表对它无能为力,所以引擎里有一张不规则形的对照表专门收这些。整门日语需要这么处理的形,就十来个。

★ 关键性质:它是多解的

这是这一章最重要的一点,也是很多人对「自动查词」的理解偏差所在。

って 这个词尾。第 13 章讲过,三种词尾都会音变成 って

所以反过来推,って 有三个可能的来源。看到 やって,它可能来自:

◆ 逆活用引擎的两步

第一步:把所有可能都推出来。不做判断,规则能匹配就产生一个候选。

第二步:拿词典去筛。推得出来但词典里没有的,直接扔掉。

所以这台引擎离不开词典——它不是纯语法的,是「语法 + 词汇」的联合推理。

而这也意味着一个直接的推论:词典越大,它越准。这本书的词典只有几百词,所以经常推不出来;真的 Yomitan 背后是十几万词的词典,覆盖率完全是另一个量级。

同样的多解还出现在:

んで  ←  ぬ / ぶ / む     死んで / 遊んで / 読んで
して  ←  す / する        話して / して
られる ← 受身 / 可能      两个意思,同一个形(第 14 章)
れる  ←  五段受身 / ら抜き 書かれる / 食べれる

它什么时候会失灵

知道原理的最大好处是你知道它什么时候会出错,以及怎么手动救

失灵一:词不在词典里

最常见的。人名、地名、专有名词、新造词、方言词。

怎么救:看看它是不是片假名(多半是外来语或名字);看看有没有汉字(有汉字的可以拆开猜);或者干脆跳过——一个不认识的名字不影响你读懂句子。

失灵二:口语缩约没被还原

这是最常见的「明明是常用词却查不到」的原因

怎么救:第 21 章有一张完整的缩约表。看到查不出来的词,先按那张表往回还原一次再查。

失灵三:故意的错字和特殊写法

动漫和网络日语里大量存在:

怎么救:把假名在心里转成汉字词试试。かんがえた考えた

◆ 这一章的实际价值

你可能会想:既然有 Yomitan,我为什么要理解它的原理?

三个理由:

一、你需要知道它什么时候错了。Yomitan 有时会给一个明显不对的结果(因为多解筛错了)。如果你不懂原理,你会以为那就是答案。

二、听力用不上 Yomitan。看动漫的时候没有鼠标可以悬停。听到一个长形,你得自己剥。

三、这个能力会自动化。剥到几百次之后,你不再需要「推」了——你听到 〜なかった 会直接感知到「否定 + 过去」,像英语母语者听到 -ed 一样。而在自动化之前,你需要一个明确的流程去执行。

手动逆活用的操作清单

把它印在脑子里。听到/看到一个不认识的长形,按顺序问:

① 最后是 ます / ません / ました / ませんでした ?
   → 敬体,剥掉,回到常体

② 最后是 た / だ ?
   → 过去,剥掉(注意逆音便:った←う/つ/る,んだ←ぬ/ぶ/む,いた←く,いだ←ぐ,した←す)

③ 最后是 ない / なかった / ん / ねぇ ?
   → 否定,剥掉,前面那个假名滑回う段

④ 中间有 られる / れる ?
   → 受身或可能,剥掉

⑤ 中间有 させる / せる ?
   → 使役,剥掉

⑥ 有 ている / てる / ちゃう / とく / なきゃ ?
   → 口语缩约或补助动词,先还原(第 21 章)

⑦ 剥到剩下一个词干 + う段假名
   → 这就是辞书形,去查

看起来长,但实际用的时候大部分词只需要一两步。四层的形很罕见(第 14 章说过)。

▸ 你早就听过

试着用上面的清单,自己剥这几个你听过的形:

答案:
許せない = 許す + 可能(え段+る)+ 否定 → 無法原谅
負けられない = 負ける + 可能/受身 + 否定 → 不能输
分かんない = 分からない 的口语(らな→んな)→ 分かる不知道
やってみる = やる + て形 + みる → 试试看
食べたかった = 食べる + たい + 过去 → (当时)想吃
言わせない = 言う + 使役 + 否定 → 我不会让你说

注意第三个 分かんない——上面那台引擎推不出来,因为它的规则表里没有「らな → んな」这条缩约。这就是「知道原理」的价值:你能看出它为什么失败,然后手动补一步。

↩ 回到生肉

「为什么装了 Yomitan 之后,读日语的体验会完全不同?」

因为它把上面那个三步流程压到了零成本

这件事的影响比「省时间」大得多。真正的变化是心理阈值

查一个词要三十秒的时候,你会想「算了,猜一下继续」。于是你跳过了这个词,而跳过的词永远不会进入你的词汇量。一页三十个生词,你会跳过二十八个,然后放弃这一页

查一个词要零点五秒的时候,你会顺手就查了。三十个生词全查一遍,也就十五秒。而查过的词里,有几个会留下印象;下次再遇到就成了熟词。

这个阈值的变化,是能不能坚持「大量输入」的分水岭。第 24 章那条路线的第 2 步就卡在这儿——所以第 23 章会把工具讲清楚。

而现在你已经知道那个工具里面装的是什么了:就是这一章这台机器,加一部大得多的词典。

这一章的一句话

逆活用就是把变形规则倒过来跑,从最外层一层层剥到辞书形;它必然是多解的(って 能来自三种词尾),所以要靠词典筛——语法推候选,词典做判决。Yomitan 就是这个,加一部十几万词的词典。

下一章:剥完单个词之后,还有一个更根本的问题——日语不写空格,你怎么知道从哪儿下刀?那台分词器用的是词图和 Viterbi,和 MeCab 一个思路。