INFOSYS 722 · 数据挖掘与大数据 · 2026 S2

九步

JIǓ BÙ

这门课收的不是模型,是一张盖满章的流转卡。

八个步骤合计 100 分,真正「跑模型」的三步只占 40 分,而「解释」一步就吃掉 20 分,「数据准备」15 分,「业务理解」10 分——后面这三样,一行 fit() 都不需要。

同一个 SDG 问题要在四条产线上各挖一遍:SPSS Modeler 拖流程图、Python 生态写代码、AWS 上开 EC2 跑 PySpark,外加一条不计分的微软线。所以提案里的每个决定都要付四次——而那份提案是 0 分的。

六卷 24 28 个零依赖 Demo 九工位 100% 四条产线 亮色排版

一句话说清这本书:评分员手上只有你的报告。你在 Jupyter 里试过的十七种参数、debug 了三小时的 join、那个终于跑通的 Spark 作业——凡是没写进报告的,在这门课里等于没有发生。所以九步不是九个技术环节,是九段必须留下痕迹的证据

这本书按九步排列,每章开头盖一枚工位章:这一章对应第几步、值多少分、评分员在这一步找什么;每章末尾一块「本章交付物」:这一章的东西该以什么形式出现在报告的哪一节。

20%
「解释」一步。全课最大的单步权重,而它一行代码都不需要——它要的是读数、判断和表达。
15%×2
数据准备与算法选择。前者会占掉你 60% 的工时,后者「换一个算法」只要几十毫秒。
5%
数据变换。它值一页纸,不值一周——但那一页里有一个会给纯噪声开专属主成分的陷阱。
ISAS · 23%
IBM SPSS Modeler。拖节点连线——流的截图本身就是方法论证据。第 5 周交。
OSAS · 23%
Python/Jupyter/MySQL/Kettle/Weka/Tableau。七样工具,两周时间,每个留一处证据。第 8 周交。
BDAS · 23%
GitHub+AWS EC2+SSH+PySpark。四次里唯一有环境风险的一次,第 8 周就该跑通。第 11 周交。
MSAS · 0%
Azure ML/Power BI。明确写着不计分——想学就折进 DataCamp 那 25 小时里,一份时间两处用。

九个工位,与它们的分值

STEP 1
业务理解
10%
STEP 2
数据理解
10%
STEP 3
数据准备
15%
STEP 4
数据变换
5%
STEP 5
选方法
10%
STEP 6
选算法
15%
STEP 7
挖掘
15%
STEP 8
解释
20%
STEP 9
行动
论文
◆ 这本书的两条主线

主线一:报告是产品,模型是零件。九步的每一步都有明确的小节编号(1.1 到 9.4),评分员按编号找证据。整份作业说明里只有一处用了强制语气,在 Step 7.2:models must execute——除此之外,全部是「你有没有说清楚」。

主线二:同一个问题挖四遍,所以每个决定都是四倍成本。选题、主数据集、分析单元+目标列这三样一旦定下,会被复制到三次迭代和一篇论文里。第一次迭代写成可复用的母版,后两次只需 40% 的工作量;反之,糊的地方你要抄三遍。

目录

卷 I · 立案 BRIEF这门课收的不是模型,先看清你到底在交什么
  1. 01你交的不是模型,是一条证据链▸ 评分权重台
  2. 02九步的来历:KDD、CRISP-DM、SEMMA 与本课的缝合▸ 四流程对照
  3. 03一个问题挖四遍:四条产线与三个一次性决策▸ 选题自检
  4. 04十三周:六个 deadline 和它们的真实成本▸ 排期倒计时
卷 II · 立题 FRAMEStep 1–2 —— 也就是这周就要交的那份提案
  1. 05Step 1(10%):把 SDG 变成一个能被数据回答的问题▸ 目标装配器
  2. 06情境评估、成本收益与项目计划:1.2 到 1.4 逐格填
  3. 07Step 2(10%):数据从哪来,以及怎么描述它▸ 数据体检台
  4. 08Step 2.3–2.4:探索,与那张数据质量清单▸ 探索台
卷 III · 备料 PREPStep 3–4 —— 20% 的分,60% 的工时
  1. 09Step 3(15%):缺失值的六种做法与它们的代价▸ 缺失策略台
  2. 10异常、重复、不一致:三种判据打出三个答案▸ 异常判据台
  3. 11Step 3.3–3.5:构造、整合、格式化▸ 特征构造台
  4. 12Step 4(5%):降维与投影,PCA 到底在做什么▸ 真 PCA
  5. 1398.6% 的准确率是坏消息:三种泄漏▸ 泄漏对照
卷 IV · 上机 MINEStep 5–7 —— 40% 的分,也是唯一必须「跑得起来」的部分
  1. 14Step 5(10%):八类任务,你的目标该配哪一类▸ 匹配器 · Apriori
  2. 15Step 6(15%):一棵决策树是怎么长出来的▸ 真决策树
  3. 16Step 6 续:五个算法同台,参数该填什么▸ 同台 · 分群
  4. 17Step 7(15%):测试设计 —— 划分、k 折、不平衡▸ k 折 · 不平衡
卷 V · 交代 READStep 8–9 —— 最大的一块分(20%)不在模型里,在你怎么读它
  1. 18Step 8(20%):混淆矩阵,与那条你可以挪的阈值▸ 阈值成本台
  2. 19ROC、AUC、增益:三张图各回答什么问题▸ ROC · 增益
  3. 20把结果读成一句人话(以及为什么必须画图)▸ 四同 · 系数
  4. 21Step 9:部署、监控、维护、增强▸ PSI 漂移台
卷 VI · 交付 SHIP四条产线怎么各走一遍,以及最后那 17%
  1. 22ISAS 与 OSAS:同一条流,两种搭法
  2. 23BDAS:EC2 + PySpark,以及 DataCamp 那 14 分▸ Spark 分区台
  3. 24研究论文(17%)、数据伦理、GenAI 边界与交付清单▸ 交付自检
✎ 怎么读这本书

提案就要交、没时间:直接读卷 II(5–8 章),四章读完就能动手写 Step 1–2。第 8 章末尾有一张「提案提交前自检」,逐条勾完再交。

想知道分在哪:读第 1 章。里面那个 Demo 会当场算给你看:两个人工作量完全相同,只是力气放的位置不同,一个 70 分一个 80 分。

已经在建模了:跳到第 13 章(泄漏)和第 18 章(阈值)。这两章各有一个能直接写进报告的段落模板,加起来不到 400 字,覆盖 Step 3.1、7.1、8.4 的评分点。

Demo 别只看:28 个 Demo 全是真跑的引擎——一份带六种脏的合成数据(480 行 SDG 3 场景,固定种子可复现)、一台真的 CART 决策树、一台用 Jacobi 旋转求特征分解的 PCA、真的 ROC 积分、真的 Apriori、真的 PSI 漂移检测。正文里出现的每个数字都是它们当场算的,包括那些对我不利的数字——第 13 章会诚实地告诉你,预处理泄漏在这份数据上只值 1.9 个百分点。

⚠ 关于书里那份数据

所有 Demo 跑的是合成数据:480 行「地区-年」,7 个特征,目标是 5 岁以下儿童死亡率,二分阈值取 SDG 指标 3.2.1 的真实目标值 25‰。生成规则写在 engine.js 里,种子固定为 7220。

用合成数据的两个理由:一,我不能凭记忆编造 WHO 的真实数字——那是假数据冒充真数据,比合成数据糟糕得多;二,合成数据的「正确答案」是已知的,所以当 PCA 给一列纯噪声开专属主成分、当决策树在深处劈它一刀,我能确定地指出「这就是过拟合的样子」。你自己的报告当然要用真实数据——这份数据的用途是让你先看清每种脏数据在指标上留下的痕迹长什么样。