卷 I · 立案CH 02工位 02/24

九步的来历:KDD、CRISP-DM、SEMMA 与本课的缝合

工位 方法论 写在报告的「研究方法」一节 前置 评分员在找:你知不知道自己在用的流程是从哪来的,以及为什么它被切成这九段。论文的 (e) research methodology 一项直接考这个。

作业说明第一段就把底牌摊开了:这九步是「a synthesis of the Cross-Industry Standard Process for Data Mining (CRISP-DM) process (SPSS, 2007) and the KDD process (Fayyad et al., 1996)」。这不是随口一提——后面九个步骤里,每一步的定义都直接引用了 Fayyad 那篇 1996 年的论文原文。也就是说,你要交的其实是一份「按 KDD 的话、走 CRISP-DM 的路」的报告。

CRISP-DMKDDSEMMA引用迭代

三套方法论,三种出身

它们不是三个流派互相竞争,而是三个不同来路的人在解决同一个问题时留下的三份笔记。

方法论出身关心什么阶段
KDD
Fayyad, Piatetsky-Shapiro & Smyth, 1996
学术界(AI Magazine)知识发现的完整过程:从原始数据到「可用的知识」。它把数据挖掘定义为整个过程里的一个步骤,而不是全部。9 步
CRISP-DM
1996–2000,SPSS/NCR/Daimler 联合
产业界项目怎么落地:谁是客户、业务目标是什么、做完了怎么部署。它是一个环,画出来带箭头绕回去。6 阶段
SEMMA
SAS
软件厂商工具里的操作顺序:Sample → Explore → Modify → Model → Assess。它故意不管业务理解和部署,因为那两段不在 SAS Enterprise Miner 里面。5 步

这个对比里藏着一个判断力:SEMMA 的起点是「取样」,也就是它假设数据已经在手上、问题已经定好了。而这门课 10% 的分给了 Step 1(业务理解)、还有一整个 Step 9(行动)——所以它不可能用 SEMMA 当主线。你在报告里可以提 SEMMA 一句作为对照,但主线必须是 CRISP-DM + KDD。

本课的九步是怎么缝出来的

点开下面任意一行,看三套流程怎么对上:

缝合的规律很清楚,值得你在报告里写出来:

  • CRISP-DM 的 Data Preparation 被切成了两步:Step 3(选择/清洗/构造/整合/格式化,15%)和 Step 4(归约/投影,5%)。切开的依据来自 KDD——Fayyad 把「清洗预处理」和「归约与投影」列成了第三步和第四步两件事。
  • CRISP-DM 的 Modeling 被切成了三步:Step 5 选方法(10%)、Step 6 选算法与参数(15%)、Step 7 真的跑(15%)。这一刀切得最有教学意义:它强迫你把「选择」和「执行」分开写,不允许你一句「我们用了随机森林」了事。
  • CRISP-DM 的 Evaluation 变成了 Step 8「Interpretation」,并且吃到 20%——这是全课最大的单步权重,也是 KDD 原文里唯一明确写着「可以返回前面任意一步」的那一步。
  • CRISP-DM 的 Deployment 变成 Step 9「Action」,四次迭代里不单独给分,但研究论文要求 Steps 1–9 全写。
◆ 为什么要切这么细:因为要打分,也因为要迭代四遍

CRISP-DM 的六阶段是给项目经理看的,粒度太粗,没法给一份学生报告打分——「Modeling 做得好不好」是一句没法量化的评语。切成九步、每步再切成四五个小节之后,每个小节都变成了一个可勾选的证据格。这对你是好事:评分标准完全透明,没有暗箱。

第二个原因更实际:这门课要你用四套工具做四遍。如果流程只有六个粗阶段,四份报告会写成四篇散文,没法互相对照。切成九步之后,四份报告可以逐格对齐,Step 1–2 甚至可以直接复用(换工具不改变业务问题)。这就是为什么第 3 章说那三个「一次性决策」值那么多钱。

迭代不是修辞,是一个要求

Step 8.5 的原文是 iterate prior steps (1–7) as required,而 KDD 原文更直白:「interpreting mined patterns, possibly returning to any of steps 1 through 7 for further iteration」。

这条经常被学生当成客套话,其实它是一个可以直接拿分的动作。做法是:在报告 8.5 写一段「回头记录」,例如——

8.5 Iteration
第一轮建模后,测试集召回率仅 0.72,而混淆矩阵显示漏报集中在
literacy 缺失的样本上。我们据此返回 Step 3.2,将 literacy 的
全局中位数填补改为按 region 分组填补(该列缺失是非随机的,
低识字率地区更容易缺失),并重跑 Step 6–7。第二轮召回率
升至 0.85,本报告呈现的是第二轮结果。第一轮的指标见附录 B。

这一段的价值不在那 0.13 的召回率,而在它证明了整条链是活的:你从 Step 8 的证据出发,修改了 Step 3 的决定,并重跑了下游。这是这门课想教的核心技能,也是「Critical Thinking」那条毕业生能力的落点。

✎ 一个省时技巧:把「第一轮」故意留着

很多人的迭代是真实发生的——你确实先用了均值填补、先跑了默认参数、先忘了做分层划分。不要把这些痕迹删掉。把第一轮的指标截图存好,8.5 就有内容可写。反过来,如果你一路顺风从没回头,那就故意做一次:换一个填补方式重跑一遍,两组指标一起报。半小时的成本,换 Step 8 里实打实的一块分。

该引谁:三个引用,四份报告通用

论文那 17% 里有一项是 (d) 探索潜在方案与方法论的文献。四次迭代的报告里,Step 1 前面也应该有一小段方法论说明。准备好这三条引用,反复用:

用在哪引什么怎么用
方法论总述、Step 3–4、Step 5–8 的定义Fayyad, U., Piatetsky-Shapiro, G., & Smyth, P. (1996). From data mining to knowledge discovery in databases. AI Magazine, 17(3), 37–54.课程指定读物,作业说明逐步引用它。你的九步定义直接引它最安全。
流程图、阶段命名、DeploymentSPSS (2007). CRISP-DM 1.0 / Clementine 12.0 CRISP-DM Guide.作业说明的 Figure 1 就是它。写 Step 9 时引它谈部署与监控。
决策过程、为什么需要决策支持Langley, A., Mintzberg, H., Pitcher, P., Posada, E., & Saint-Macary, J. (1995). Opening up decision making. Organization Science, 6(3), 260–279.第 1 周的指定读物。Step 1.1 写「决策者是谁、决策怎么发生」时引它,能立刻把报告从技术文档拉回商学院语境。

另外两本课程教材(Dean 2014《Big Data, Data Mining, and Machine Learning》、Marr 2016《Big Data in Practice》)可以从 UoA 图书馆免费下载。Marr 那本是 45 个公司案例,拿来写论文的 (a) 实际问题和引言最省事——找一个和你 SDG 主题相近的案例引一句,比空谈「大数据很重要」强得多。

▣ 本章交付物 —— 报告里放什么

1. 一段方法论说明(约 150 字),放在 Step 1 之前或论文的 Methodology 一节:

本研究采用的流程是 CRISP-DM (SPSS, 2007) 与 KDD (Fayyad et al.,
1996) 的综合:将 CRISP-DM 的 Data Preparation 阶段按 KDD 的划分
拆为数据准备与数据变换两步,将 Modeling 阶段拆为方法选择、算法
选择与执行三步,以便每一步的产出可被独立评估。SEMMA (SAS) 亦为
常见流程,但其起点为取样、终点为评估,不涵盖业务理解与部署,
故未采用。整个过程是迭代的:Step 8 的解释结果可触发返回
Step 1–7 任一步(见 8.5)。

2. 一张三列对照表(本课 Step / CRISP-DM / KDD),就是上面那个 Demo 的内容。放在方法论一节,占半页,直接证明你读过原始文献。

3. 一个空的 8.5 小节,标题写「Iteration」。从今天起,任何时候你回头改了上游,就往里记一行。

这一章的一句话

本课的九步不是第四种方法论,而是把 CRISP-DM 的六阶段按 KDD 的九步重新切细——切细的目的是让每一步都能单独打分,代价是你必须照编号写;而「可以回到任何一步」这句话不是客套,是 Step 8.5 的得分点。

下一章讲这门课最特别的结构:同一个问题要在四条工具线上各挖一遍。这件事决定了你在提案里的三个决定,每一个都是四倍成本。