九步的来历:KDD、CRISP-DM、SEMMA 与本课的缝合
作业说明第一段就把底牌摊开了:这九步是「a synthesis of the Cross-Industry Standard Process for Data Mining (CRISP-DM) process (SPSS, 2007) and the KDD process (Fayyad et al., 1996)」。这不是随口一提——后面九个步骤里,每一步的定义都直接引用了 Fayyad 那篇 1996 年的论文原文。也就是说,你要交的其实是一份「按 KDD 的话、走 CRISP-DM 的路」的报告。
三套方法论,三种出身
它们不是三个流派互相竞争,而是三个不同来路的人在解决同一个问题时留下的三份笔记。
| 方法论 | 出身 | 关心什么 | 阶段 |
|---|---|---|---|
| KDD Fayyad, Piatetsky-Shapiro & Smyth, 1996 | 学术界(AI Magazine) | 知识发现的完整过程:从原始数据到「可用的知识」。它把数据挖掘定义为整个过程里的一个步骤,而不是全部。 | 9 步 |
| CRISP-DM 1996–2000,SPSS/NCR/Daimler 联合 | 产业界 | 项目怎么落地:谁是客户、业务目标是什么、做完了怎么部署。它是一个环,画出来带箭头绕回去。 | 6 阶段 |
| SEMMA SAS | 软件厂商 | 工具里的操作顺序:Sample → Explore → Modify → Model → Assess。它故意不管业务理解和部署,因为那两段不在 SAS Enterprise Miner 里面。 | 5 步 |
这个对比里藏着一个判断力:SEMMA 的起点是「取样」,也就是它假设数据已经在手上、问题已经定好了。而这门课 10% 的分给了 Step 1(业务理解)、还有一整个 Step 9(行动)——所以它不可能用 SEMMA 当主线。你在报告里可以提 SEMMA 一句作为对照,但主线必须是 CRISP-DM + KDD。
本课的九步是怎么缝出来的
点开下面任意一行,看三套流程怎么对上:
缝合的规律很清楚,值得你在报告里写出来:
- CRISP-DM 的 Data Preparation 被切成了两步:Step 3(选择/清洗/构造/整合/格式化,15%)和 Step 4(归约/投影,5%)。切开的依据来自 KDD——Fayyad 把「清洗预处理」和「归约与投影」列成了第三步和第四步两件事。
- CRISP-DM 的 Modeling 被切成了三步:Step 5 选方法(10%)、Step 6 选算法与参数(15%)、Step 7 真的跑(15%)。这一刀切得最有教学意义:它强迫你把「选择」和「执行」分开写,不允许你一句「我们用了随机森林」了事。
- CRISP-DM 的 Evaluation 变成了 Step 8「Interpretation」,并且吃到 20%——这是全课最大的单步权重,也是 KDD 原文里唯一明确写着「可以返回前面任意一步」的那一步。
- CRISP-DM 的 Deployment 变成 Step 9「Action」,四次迭代里不单独给分,但研究论文要求 Steps 1–9 全写。
CRISP-DM 的六阶段是给项目经理看的,粒度太粗,没法给一份学生报告打分——「Modeling 做得好不好」是一句没法量化的评语。切成九步、每步再切成四五个小节之后,每个小节都变成了一个可勾选的证据格。这对你是好事:评分标准完全透明,没有暗箱。
第二个原因更实际:这门课要你用四套工具做四遍。如果流程只有六个粗阶段,四份报告会写成四篇散文,没法互相对照。切成九步之后,四份报告可以逐格对齐,Step 1–2 甚至可以直接复用(换工具不改变业务问题)。这就是为什么第 3 章说那三个「一次性决策」值那么多钱。
迭代不是修辞,是一个要求
Step 8.5 的原文是 iterate prior steps (1–7) as required,而 KDD 原文更直白:「interpreting mined patterns, possibly returning to any of steps 1 through 7 for further iteration」。
这条经常被学生当成客套话,其实它是一个可以直接拿分的动作。做法是:在报告 8.5 写一段「回头记录」,例如——
8.5 Iteration 第一轮建模后,测试集召回率仅 0.72,而混淆矩阵显示漏报集中在 literacy 缺失的样本上。我们据此返回 Step 3.2,将 literacy 的 全局中位数填补改为按 region 分组填补(该列缺失是非随机的, 低识字率地区更容易缺失),并重跑 Step 6–7。第二轮召回率 升至 0.85,本报告呈现的是第二轮结果。第一轮的指标见附录 B。
这一段的价值不在那 0.13 的召回率,而在它证明了整条链是活的:你从 Step 8 的证据出发,修改了 Step 3 的决定,并重跑了下游。这是这门课想教的核心技能,也是「Critical Thinking」那条毕业生能力的落点。
很多人的迭代是真实发生的——你确实先用了均值填补、先跑了默认参数、先忘了做分层划分。不要把这些痕迹删掉。把第一轮的指标截图存好,8.5 就有内容可写。反过来,如果你一路顺风从没回头,那就故意做一次:换一个填补方式重跑一遍,两组指标一起报。半小时的成本,换 Step 8 里实打实的一块分。
该引谁:三个引用,四份报告通用
论文那 17% 里有一项是 (d) 探索潜在方案与方法论的文献。四次迭代的报告里,Step 1 前面也应该有一小段方法论说明。准备好这三条引用,反复用:
| 用在哪 | 引什么 | 怎么用 |
|---|---|---|
| 方法论总述、Step 3–4、Step 5–8 的定义 | Fayyad, U., Piatetsky-Shapiro, G., & Smyth, P. (1996). From data mining to knowledge discovery in databases. AI Magazine, 17(3), 37–54. | 课程指定读物,作业说明逐步引用它。你的九步定义直接引它最安全。 |
| 流程图、阶段命名、Deployment | SPSS (2007). CRISP-DM 1.0 / Clementine 12.0 CRISP-DM Guide. | 作业说明的 Figure 1 就是它。写 Step 9 时引它谈部署与监控。 |
| 决策过程、为什么需要决策支持 | Langley, A., Mintzberg, H., Pitcher, P., Posada, E., & Saint-Macary, J. (1995). Opening up decision making. Organization Science, 6(3), 260–279. | 第 1 周的指定读物。Step 1.1 写「决策者是谁、决策怎么发生」时引它,能立刻把报告从技术文档拉回商学院语境。 |
另外两本课程教材(Dean 2014《Big Data, Data Mining, and Machine Learning》、Marr 2016《Big Data in Practice》)可以从 UoA 图书馆免费下载。Marr 那本是 45 个公司案例,拿来写论文的 (a) 实际问题和引言最省事——找一个和你 SDG 主题相近的案例引一句,比空谈「大数据很重要」强得多。
1. 一段方法论说明(约 150 字),放在 Step 1 之前或论文的 Methodology 一节:
本研究采用的流程是 CRISP-DM (SPSS, 2007) 与 KDD (Fayyad et al., 1996) 的综合:将 CRISP-DM 的 Data Preparation 阶段按 KDD 的划分 拆为数据准备与数据变换两步,将 Modeling 阶段拆为方法选择、算法 选择与执行三步,以便每一步的产出可被独立评估。SEMMA (SAS) 亦为 常见流程,但其起点为取样、终点为评估,不涵盖业务理解与部署, 故未采用。整个过程是迭代的:Step 8 的解释结果可触发返回 Step 1–7 任一步(见 8.5)。
2. 一张三列对照表(本课 Step / CRISP-DM / KDD),就是上面那个 Demo 的内容。放在方法论一节,占半页,直接证明你读过原始文献。
3. 一个空的 8.5 小节,标题写「Iteration」。从今天起,任何时候你回头改了上游,就往里记一行。
这一章的一句话
本课的九步不是第四种方法论,而是把 CRISP-DM 的六阶段按 KDD 的九步重新切细——切细的目的是让每一步都能单独打分,代价是你必须照编号写;而「可以回到任何一步」这句话不是客套,是 Step 8.5 的得分点。
下一章讲这门课最特别的结构:同一个问题要在四条工具线上各挖一遍。这件事决定了你在提案里的三个决定,每一个都是四倍成本。