卷 IV · 上机CH 14工位 14/24

Step 5(10%):八类任务,你的目标该配哪一类

工位 STEP 5.1 / 5.2 目标↔方法逐条讨论 · 选定方法 10% 评分员在找:作业原话是 match and discuss。要看到你排除了哪些方法、各自一句理由——只写选中的那个,最多一半分。

Step 5 是九步里最容易被一句话打发的一步:「本项目采用分类方法。」——完。这一步 10% 的分因此大量流失,而它其实是最好写的一步:你不需要跑任何代码,只需要把八类任务摆出来,逐条说明为什么不是它。课程的学习目标里还专门点了六种应用(预测建模、分群、增量响应建模、时序、文本分析、推荐),这一章会把它们全放进同一张表。

Step 5.1八类任务Aprioriliftuplift

先分清「方法」和「算法」

作业把它们拆成了 Step 5 和 Step 6 两步,因为它们真的是两件事:

Step 5 · 方法(method)Step 6 · 算法(algorithm)
回答什么这是一个什么形状的问题哪台机器去解
取值分类/回归/分群/关联/异常/文本/时序/增量响应C5.0、CHAID、逻辑回归、随机森林、K-Means、Apriori……
由什么决定Step 1.3 的目标(输出形态是名单?数值?分组?规则?)数据的性质(样本量、维度、类型)+可解释性要求
换工具会变吗不会——四次迭代这一节可以复用会(三条产线的算法库不同)

八类任务对照表

下面这台把八类任务、各自的候选算法、以及在三条产线上的具体实现摆在一起。挨个点一遍,找到你的那一类——顺便看清另外七类为什么不是:

选择的路径其实只有一句话:看 Step 1.3 里「输出形态」那一栏。

Step 1.3 说要输出……方法再确认一件事
一份名单(谁风险高/谁会流失)分类目标列是不是已经二分好了?没有就在 3.3 造一个(阈值要有来源)
一个数字(下一期是多少)回归有没有一个「用上一期值当预测」的基线可以比?没有基线的回归结果无法评价
若干群体画像分群业务方能不能给每个群配一个不同的动作?不能,就不该做分群
一批规则(什么和什么一起出现)关联数据是不是「篮子」形态(一行一次交易,含多个项目)?
一份可疑清单异常检测有没有标签可以验证?没有的话,验证只能靠人工抽检
文本的类别或主题文本分析标注成本算过了吗?八千条推文的人工标注是几十小时
未来若干期的曲线时序划分必须按时间切(第 13 章)
「给谁发券才会改变行为增量响应(uplift)必须有处理组和对照组的数据。没有随机分组,这条路不通
◆ 最省事的加分动作:同一份数据做两类任务

如果你的目标列是连续的(死亡率、缺水天数、辍学率),你可以同时做回归和分类,成本几乎是零:同一份特征、同一次划分,跑两个模型。

好处是三重的:① Step 5.1 的讨论立刻有内容(「两类方法都适用,我们都做了,并比较哪个更支撑 1.1 的决策」);② Step 7 的产出翻倍;③ Step 8 有话可写——回归告诉你「差多少」,分类告诉你「谁不达标」,而决策者要的其实是后者加上前者的量级。

本书示例数据就是这样设计的:u5mr 连续(回归,测试集 RMSE 6.42、R² 0.815),risk 二分(分类,准确率 0.875、AUC 0.943)。两组数字在报告里互相印证,比单独一组有力得多。

关联规则:一个「支持度最高却毫无关系」的现场

八类任务里,关联规则最容易被误用,因为它的三个指标很容易混。下面这台是真的 Apriori:24 个「母婴服务包」篮子,逐层生成频繁项集,再算规则:

指标定义回答
支持度 supportP(A ∩ B)这条规则覆盖多少交易?太低的规则没有业务价值
置信度 confidenceP(B | A)买了 A 的人里,多少也买了 B?
提升度 liftP(B | A) / P(B)A 的出现让 B 的概率提高了多少倍。只有 lift > 1 才叫「发现」

看 demo 里的「疫苗」:它的支持度是全场最高的 0.833,任何规则指向它的置信度都很高(产检 → 疫苗,置信度 0.857)。但它的 lift 只有 1.03

原因:疫苗到处都在。随便猜「这个人领了疫苗」本来就有 83% 的准确率,所以「做了产检的人有 85.7% 也领了疫苗」几乎没有增加任何信息。置信度高不等于有关系——这是关联分析里最常见的误读。

真正的发现是那两组 lift 高的:

  • 母乳指导 ↔ 营养包,lift 1.80(双向都是)。两者真的成对出现。
  • 补铁剂 → 产检,置信度 1.00,lift 1.71。领补铁剂的人 100% 都做了产检。

而第二条反过来读,就是一个可执行的动作:产检 → 补铁剂的置信度只有 0.714,也就是说做了产检但没领补铁剂的那 28.6%,是一份现成的入户走访名单。(第 19 章会讲这种「把规则变成名单」的思路怎么变成钱。)

✎ 报告里写规则的格式:一条规则配一个动作

不要只贴一张规则表。挑 3–5 条 lift 最高的,每条写成三行:

规则 R2:{补铁剂} → {产检}
  支持度 0.417(24 个服务包中的 10 个)
  置信度 1.000 提升度 1.71
解读:领取补铁剂的服务对象全部完成了产检,说明两项服务在
      现有流程中已被捆绑发放。
动作:反向筛选「已产检但未领补铁剂」的 28.6%(约 4 人),
      作为下一轮入户走访的优先名单;若该缺口源于库存而非
      流程,则应在 9.1 的部署方案中加入库存预警。

「动作」那一行是 Step 8.3 与 Step 9.1 的分。没有动作的规则表,在这门课里等于没有结论。

增量响应建模:课程学习目标里那个冷门词

LO3 明确点了 incremental response modeling,它在中文里通常叫增量响应或 uplift 建模。值得单独说两句,因为它是唯一一个直接回答因果问题的方法,而且很少有人写对。

普通的响应模型预测「谁会响应」;uplift 模型预测「谁会因为我的干预而响应」。差别体现在四类人身上:

四类人干预了会怎样不干预会怎样该不该投
可说服者(persuadables)响应不响应只有这一类值得投
稳定客户(sure things)响应响应不投也会来,投了是浪费
无望者(lost causes)不响应不响应投了也没用
睡狗(sleeping dogs)不响应响应投了反而有害(打扰引起反感)

普通响应模型会把「稳定客户」排在最前面(他们响应概率最高),于是预算全花在本来就会来的人身上。uplift 模型才会把「可说服者」挑出来。

实现上最简单的做法是双模型法:在处理组上训一个模型、在对照组上训一个模型,两者的预测概率相减就是 uplift。前提是你必须有随机分组的数据——这也是为什么它在这门课里通常只能作为「未来增强」写进 Step 9.4:「若后续能与卫生部合作进行随机对照投放,可将本模型升级为增量响应模型,以区分『会未达标』与『会因干预而改善』两类地区。」这一句话既展示了你知道这个方法,又诚实地说明了当前数据做不到。

5.1 的讨论怎么写:一个模板

5.1 Match and discuss the objectives to data-mining methods

1.3 的目标要求输出「按未达标风险排序的地区名单 + 每个地区的
概率」。据此逐类评估八种数据挖掘方法:

· 分类(选用):直接产出类别与概率,可排序,与 1.1 的「选出
  15 个优先地区」严格对应。目标列由 SDG 3.2 阈值定义,已存在。
· 回归(并用作补充):可预测 u5mr 具体数值,用于估计干预后的
  改善幅度(1.2.5 成本收益需要这个量级)。二者共用同一特征集。
· 分群(不选):能给出地区画像,但不产出排序,无法直接支撑
  「选 15 个」这一决策;作为 8.1 的辅助分析保留(见 6.1)。
· 关联规则(不选):数据为「地区-年 × 指标」的宽表,非交易篮子
  形态,无法构造有意义的项集。
· 异常检测(不选):目标不是找「不正常的地区」而是找「达不到
  既定标准的地区」,后者有明确阈值,属监督问题。
· 文本分析(不选):数据集不含文本字段。
· 时序(不选为主方法):观测期仅 9 年、每地区 9 点,不足以做
  可靠的序列建模;年份作为特征纳入分类模型(见 3.3)。
· 增量响应(不可行):无随机对照投放数据,缺少处理组/对照组
  标识;列为 9.4 未来增强方向。

5.2 结论:以二分类为主方法,回归为补充方法。

这一段约 300 字,八类各一句,10% 的分基本全在里面。而且它四次迭代通用——换工具不改变问题的形状。

▣ 本章交付物 —— 报告里放什么

1. Step 5.1(约 300 字):上面那个模板,八类任务逐条评估,每条一句理由。

2. Step 5.2(两行):结论 + 主方法与补充方法。

3. 如果你做了关联分析:3–5 条规则,每条按「支持度/置信度/提升度 + 解读 + 动作」三行式写。并且明确指出 lift ≈ 1 的那些高置信度规则为什么不算发现。

4. 一句留给 9.4 的话:uplift 那段模板,把「未来能做但现在数据不支持」的方法写出来。这在评分上算 Critical Thinking,不算缺陷。

这一章的一句话

Step 5 的分在「为什么不选另外七个」:把八类任务逐条评估、各给一句排除理由,这 300 字四次迭代通用;顺带记住关联规则里那个最常见的误读——支持度 0.833 的商品,指向它的规则 lift 只有 1.03,置信度高不等于有关系。

方法定了,下一章开始选算法。我们从决策树开始,因为它是唯一一种你能亲眼看见它「怎么想」的算法——而且这本书里那棵树的每一刀,都是当场算出来的。