Step 5(10%):八类任务,你的目标该配哪一类
Step 5 是九步里最容易被一句话打发的一步:「本项目采用分类方法。」——完。这一步 10% 的分因此大量流失,而它其实是最好写的一步:你不需要跑任何代码,只需要把八类任务摆出来,逐条说明为什么不是它。课程的学习目标里还专门点了六种应用(预测建模、分群、增量响应建模、时序、文本分析、推荐),这一章会把它们全放进同一张表。
先分清「方法」和「算法」
作业把它们拆成了 Step 5 和 Step 6 两步,因为它们真的是两件事:
| Step 5 · 方法(method) | Step 6 · 算法(algorithm) | |
|---|---|---|
| 回答什么 | 这是一个什么形状的问题 | 用哪台机器去解 |
| 取值 | 分类/回归/分群/关联/异常/文本/时序/增量响应 | C5.0、CHAID、逻辑回归、随机森林、K-Means、Apriori…… |
| 由什么决定 | Step 1.3 的目标(输出形态是名单?数值?分组?规则?) | 数据的性质(样本量、维度、类型)+可解释性要求 |
| 换工具会变吗 | 不会——四次迭代这一节可以复用 | 会(三条产线的算法库不同) |
八类任务对照表
下面这台把八类任务、各自的候选算法、以及在三条产线上的具体实现摆在一起。挨个点一遍,找到你的那一类——顺便看清另外七类为什么不是:
选择的路径其实只有一句话:看 Step 1.3 里「输出形态」那一栏。
| Step 1.3 说要输出…… | 方法 | 再确认一件事 |
|---|---|---|
| 一份名单(谁风险高/谁会流失) | 分类 | 目标列是不是已经二分好了?没有就在 3.3 造一个(阈值要有来源) |
| 一个数字(下一期是多少) | 回归 | 有没有一个「用上一期值当预测」的基线可以比?没有基线的回归结果无法评价 |
| 若干群体画像 | 分群 | 业务方能不能给每个群配一个不同的动作?不能,就不该做分群 |
| 一批规则(什么和什么一起出现) | 关联 | 数据是不是「篮子」形态(一行一次交易,含多个项目)? |
| 一份可疑清单 | 异常检测 | 有没有标签可以验证?没有的话,验证只能靠人工抽检 |
| 文本的类别或主题 | 文本分析 | 标注成本算过了吗?八千条推文的人工标注是几十小时 |
| 未来若干期的曲线 | 时序 | 划分必须按时间切(第 13 章) |
| 「给谁发券才会改变行为」 | 增量响应(uplift) | 必须有处理组和对照组的数据。没有随机分组,这条路不通 |
如果你的目标列是连续的(死亡率、缺水天数、辍学率),你可以同时做回归和分类,成本几乎是零:同一份特征、同一次划分,跑两个模型。
好处是三重的:① Step 5.1 的讨论立刻有内容(「两类方法都适用,我们都做了,并比较哪个更支撑 1.1 的决策」);② Step 7 的产出翻倍;③ Step 8 有话可写——回归告诉你「差多少」,分类告诉你「谁不达标」,而决策者要的其实是后者加上前者的量级。
本书示例数据就是这样设计的:u5mr 连续(回归,测试集 RMSE 6.42、R² 0.815),risk 二分(分类,准确率 0.875、AUC 0.943)。两组数字在报告里互相印证,比单独一组有力得多。
关联规则:一个「支持度最高却毫无关系」的现场
八类任务里,关联规则最容易被误用,因为它的三个指标很容易混。下面这台是真的 Apriori:24 个「母婴服务包」篮子,逐层生成频繁项集,再算规则:
| 指标 | 定义 | 回答 |
|---|---|---|
| 支持度 support | P(A ∩ B) | 这条规则覆盖多少交易?太低的规则没有业务价值 |
| 置信度 confidence | P(B | A) | 买了 A 的人里,多少也买了 B? |
| 提升度 lift | P(B | A) / P(B) | A 的出现让 B 的概率提高了多少倍。只有 lift > 1 才叫「发现」 |
看 demo 里的「疫苗」:它的支持度是全场最高的 0.833,任何规则指向它的置信度都很高(产检 → 疫苗,置信度 0.857)。但它的 lift 只有 1.03。
原因:疫苗到处都在。随便猜「这个人领了疫苗」本来就有 83% 的准确率,所以「做了产检的人有 85.7% 也领了疫苗」几乎没有增加任何信息。置信度高不等于有关系——这是关联分析里最常见的误读。
真正的发现是那两组 lift 高的:
- 母乳指导 ↔ 营养包,lift 1.80(双向都是)。两者真的成对出现。
- 补铁剂 → 产检,置信度 1.00,lift 1.71。领补铁剂的人 100% 都做了产检。
而第二条反过来读,就是一个可执行的动作:产检 → 补铁剂的置信度只有 0.714,也就是说做了产检但没领补铁剂的那 28.6%,是一份现成的入户走访名单。(第 19 章会讲这种「把规则变成名单」的思路怎么变成钱。)
不要只贴一张规则表。挑 3–5 条 lift 最高的,每条写成三行:
规则 R2:{补铁剂} → {产检}
支持度 0.417(24 个服务包中的 10 个)
置信度 1.000 提升度 1.71
解读:领取补铁剂的服务对象全部完成了产检,说明两项服务在
现有流程中已被捆绑发放。
动作:反向筛选「已产检但未领补铁剂」的 28.6%(约 4 人),
作为下一轮入户走访的优先名单;若该缺口源于库存而非
流程,则应在 9.1 的部署方案中加入库存预警。
「动作」那一行是 Step 8.3 与 Step 9.1 的分。没有动作的规则表,在这门课里等于没有结论。
增量响应建模:课程学习目标里那个冷门词
LO3 明确点了 incremental response modeling,它在中文里通常叫增量响应或 uplift 建模。值得单独说两句,因为它是唯一一个直接回答因果问题的方法,而且很少有人写对。
普通的响应模型预测「谁会响应」;uplift 模型预测「谁会因为我的干预而响应」。差别体现在四类人身上:
| 四类人 | 干预了会怎样 | 不干预会怎样 | 该不该投 |
|---|---|---|---|
| 可说服者(persuadables) | 响应 | 不响应 | 只有这一类值得投 |
| 稳定客户(sure things) | 响应 | 响应 | 不投也会来,投了是浪费 |
| 无望者(lost causes) | 不响应 | 不响应 | 投了也没用 |
| 睡狗(sleeping dogs) | 不响应 | 响应 | 投了反而有害(打扰引起反感) |
普通响应模型会把「稳定客户」排在最前面(他们响应概率最高),于是预算全花在本来就会来的人身上。uplift 模型才会把「可说服者」挑出来。
实现上最简单的做法是双模型法:在处理组上训一个模型、在对照组上训一个模型,两者的预测概率相减就是 uplift。前提是你必须有随机分组的数据——这也是为什么它在这门课里通常只能作为「未来增强」写进 Step 9.4:「若后续能与卫生部合作进行随机对照投放,可将本模型升级为增量响应模型,以区分『会未达标』与『会因干预而改善』两类地区。」这一句话既展示了你知道这个方法,又诚实地说明了当前数据做不到。
5.1 的讨论怎么写:一个模板
5.1 Match and discuss the objectives to data-mining methods 1.3 的目标要求输出「按未达标风险排序的地区名单 + 每个地区的 概率」。据此逐类评估八种数据挖掘方法: · 分类(选用):直接产出类别与概率,可排序,与 1.1 的「选出 15 个优先地区」严格对应。目标列由 SDG 3.2 阈值定义,已存在。 · 回归(并用作补充):可预测 u5mr 具体数值,用于估计干预后的 改善幅度(1.2.5 成本收益需要这个量级)。二者共用同一特征集。 · 分群(不选):能给出地区画像,但不产出排序,无法直接支撑 「选 15 个」这一决策;作为 8.1 的辅助分析保留(见 6.1)。 · 关联规则(不选):数据为「地区-年 × 指标」的宽表,非交易篮子 形态,无法构造有意义的项集。 · 异常检测(不选):目标不是找「不正常的地区」而是找「达不到 既定标准的地区」,后者有明确阈值,属监督问题。 · 文本分析(不选):数据集不含文本字段。 · 时序(不选为主方法):观测期仅 9 年、每地区 9 点,不足以做 可靠的序列建模;年份作为特征纳入分类模型(见 3.3)。 · 增量响应(不可行):无随机对照投放数据,缺少处理组/对照组 标识;列为 9.4 未来增强方向。 5.2 结论:以二分类为主方法,回归为补充方法。
这一段约 300 字,八类各一句,10% 的分基本全在里面。而且它四次迭代通用——换工具不改变问题的形状。
1. Step 5.1(约 300 字):上面那个模板,八类任务逐条评估,每条一句理由。
2. Step 5.2(两行):结论 + 主方法与补充方法。
3. 如果你做了关联分析:3–5 条规则,每条按「支持度/置信度/提升度 + 解读 + 动作」三行式写。并且明确指出 lift ≈ 1 的那些高置信度规则为什么不算发现。
4. 一句留给 9.4 的话:uplift 那段模板,把「未来能做但现在数据不支持」的方法写出来。这在评分上算 Critical Thinking,不算缺陷。
这一章的一句话
Step 5 的分在「为什么不选另外七个」:把八类任务逐条评估、各给一句排除理由,这 300 字四次迭代通用;顺带记住关联规则里那个最常见的误读——支持度 0.833 的商品,指向它的规则 lift 只有 1.03,置信度高不等于有关系。
方法定了,下一章开始选算法。我们从决策树开始,因为它是唯一一种你能亲眼看见它「怎么想」的算法——而且这本书里那棵树的每一刀,都是当场算出来的。