卷 I · 立案CH 01工位 01/24

你交的不是模型,是一条证据链

工位 STEP 1–9 全局 100% 评分员在找:九个编号,每个编号下面有没有一段话、一张图或一张表,能证明你真的做了那件事。他们不会打开你的 .ipynb 重跑一遍。

这门课的名字叫「数据挖掘与大数据」,课号在商学院信息系统专业下面。这两件事加起来决定了一个你必须尽早接受的事实:它的分不在模型里。八个步骤合计 100 分,真正「跑模型」的那三步(选方法、选算法、挖掘)加起来 40 分,而「解释」一步就吃掉 20 分,「数据准备」15 分,「业务理解」10 分——后面这三样,一行 fit() 都不需要。

课程真相权重证据链怎么读这本书

先把这门课的规则摆平

2026 学期二的六项评估,加起来正好 100%:

交付内容权重截止
Iteration 1 提案Step 1–20%第 2 周 · 7 月 31 日
Iteration 2 ISASStep 1–8,用 SPSS Modeler23%第 5 周 · 8 月 21 日
DataCamp25 小时以上14%第 7 周 · 9 月 14 日
Iteration 3 OSASStep 1–8,用 Python/Weka/Kettle/Tableau23%第 8 周 · 9 月 25 日
Iteration 4 BDASStep 1–8,用 AWS + PySpark23%第 11 周 · 10 月 16 日
研究论文Step 1–9 全写一遍,10–20 页 APA17%第 13 周 · 10 月 30 日

没有笔试。全部是个人作业(不是小组)。及格线是总分 50%。三次迭代加起来 69%,而它们是同一份东西换三套工具做三遍。

这个结构说明了这门课真正想训练的能力:不是「你会不会用某个算法」,而是你能不能把一件分析工作拆成可复核的九段,然后在换了工具之后还能把同一件事再说一遍

九步的分是这样分的

每一次迭代(Step 1–8)内部的权重是固定的,作业说明里逐条写着百分比。把它们画成条形,你会立刻看到这门课的重心在哪:

请特别注意第三个标签页那组数字。假设有两个人,工作量完全一样——都是「一半的步骤做到满分,另一半做到一半」,只是位置不同:

  • 模型狂人:Step 5、6、7(选方法、选算法、跑模型)满分,其余一半 → 70 分
  • 流程党:除了 5–7 之外全满分,建模三步只做一半 → 80 分

差 10 分,一个 B+ 和一个 A−。而绝大多数工程背景的人,本能地会往「模型狂人」那边跑。这本书存在的第一个理由,就是把你的注意力从那 40% 挪回来一半。

◆ 这本书的两条主线

主线一:报告是产品,模型是零件。评分员手上有的东西只有你的报告。你在 Jupyter 里试过的十七种参数、debug 了三小时的 join、那个终于跑通的 PySpark 作业——凡是没有写进报告的,在这门课里等于没有发生。所以这本书每一章末尾都有一块「本章交付物」,直接告诉你这一章的东西该以什么形式出现在报告的哪一节。

主线二:同一个问题要挖四遍,所以每个决定都是四倍成本。选题、数据集、目标列这三样一旦定下,会被复制到 ISAS、OSAS、BDAS 三次迭代和最后那篇论文里。第 2 周省下的半小时思考,会在第 5、8、11 周各还一次。这就是为什么 0 分的提案是这门课最重要的一次交付。

「证据链」是什么意思

把作业说明的九个步骤连起来读一遍,你会发现它其实是一条因果链条,每一环都要求你交出上一环的产物:

STEP 1
业务理解
10%
STEP 2
数据理解
10%
STEP 3
数据准备
15%
STEP 4
数据变换
5%
STEP 5
选方法
10%
STEP 6
选算法
15%
STEP 7
挖掘
15%
STEP 8
解释
20%
STEP 9
行动
论文

链条的意思是:Step 5 的答案必须能追回 Step 1.1(作业说明的原话是「match and discuss the objectives of data mining (1.1) to data mining methods」——它甚至把小节号写在了括号里)。Step 6 的算法必须能追回 Step 5 的方法Step 8 的解释必须能追回 Step 1 的业务目标,否则「你挖出的这个模式对谁有什么用」这句话就没法写。

反过来说,最常见的扣分方式不是做错,而是断链:Step 1 说要帮卫生部分配医生,Step 5 却选了聚类,Step 8 又在讨论准确率——三段各自都不算错,但没有一条线把它们串起来。

⚠ 唯一一处「必须真的跑起来」

整份作业说明里只有一处用了强制语气,在 Step 7.2:conduct data mining — classify, regress, cluster, etc. (models must execute)

也就是说:报告可以写得漂亮,但如果你交上去的 SPSS 流打开就报错、Notebook 从上到下 Restart & Run All 会红一片、PySpark 作业只有截图没有代码——这一条会直接判掉。每次提交前,从头到尾清空状态跑一次,这是这门课最便宜的保险。

那 14 分的 DataCamp 是白给的

25 小时以上的 DataCamp 学习占 14%,比整个 Step 3(15%)差不多,比 Step 4(5%)多两倍,而且它不需要思考,只需要花时间。用你自己的 uni 邮箱登进课程指定的 DataCamp 环境,把和这门课相关的 PySpark、Python ML、Tableau 轨道刷够时数即可。

它唯一的风险是忘记:截止在第 7 周(9 月 14 日),刚好卡在你交完 ISAS、正忙着搭 OSAS 的时候。把它拆成每周 2.5 小时,从第 1 周开始刷。(第 23 章会给一份具体刷哪些轨道的清单。)

怎么读这本书

这本书按九步排列,六卷 24 章:

  • 卷 I(本卷,1–4 章):规则、方法论来历、四条工具线、时间表。全书的地基,两小时能读完。
  • 卷 II(5–8 章):Step 1–2,也就是这周就要交的那份提案。时间紧就直接从第 5 章开始读,读完就能动手写。
  • 卷 III(9–13 章):Step 3–4。20% 的分,但会占掉你 60% 的工时,也是最容易出隐蔽错误的地方(第 13 章那个「98.6% 的准确率」)。
  • 卷 IV(14–17 章):Step 5–7。方法、算法、测试设计。
  • 卷 V(18–21 章):Step 8–9。本书主星卷——单步 20% 的那一块,以及怎么把结果读成一句人话。
  • 卷 VI(22–24 章):四条产线各怎么走一遍,加论文、伦理与交付清单。

书里有 28 个可交互 Demo,全部是零依赖的真引擎:一份带六种脏的合成数据(480 行,SDG 3 场景)、一台真的决策树、一台真的 PCA、真的混淆矩阵与 ROC、真的 Apriori、真的 PSI 漂移检测。正文里出现的每个数字,都是这些引擎当场算出来的,包括那些看起来对我不利的数字——比如第 13 章会诚实地告诉你,预处理泄漏在这份数据上只值 1.9 个百分点,而不是网上常说的「天差地别」。

▣ 本章交付物 —— 报告里放什么

1. 先建一个报告骨架,直接用九步的编号当小标题。不要自己发明结构。评分员按编号找证据,你就按编号给:

1. Business / Situation Understanding
   1.1 Objectives of the business/situation
   1.2 Assessment of the situation
   1.3 Data mining objectives
   1.4 Project plan
2. Data Understanding
   2.1 Initial data collection   2.2 Data description
   2.3 Data exploration         2.4 Data quality verification
3. Data Preparation
   3.1 Select  3.2 Clean  3.3 Construct  3.4 Integrate  3.5 Format
4. Data Transformation
   4.1 Reduce  4.2 Project
5. Data-mining Method Selection
   5.1 Match objectives to methods (discussion)  5.2 Selection
6. Data-mining Algorithm Selection
   6.1 Exploratory analysis  6.2 Selection  6.3 Model & parameters
7. Data Mining
   7.1 Test design  7.2 Execute (models must execute)  7.3 Search for patterns
8. Interpretation
   8.1 Study patterns  8.2 Visualise  8.3 Interpret
   8.4 Assess & evaluate  8.5 Iterate as required
9. Action (研究论文里必须写;四次迭代里不单独计分)
   9.1 Apply & deploy  9.2 Monitor  9.3 Maintain  9.4 Enhance

2. 每个编号下先写一句占位话,例如「3.4 本项目仅使用单一数据源,无需整合,理由如下:……」。空着的编号是负分,写「不适用 + 理由」的编号是满分。这是整门课最高杠杆的一个动作,做一次,四份报告都受益。

3. 顺手记一件事:作业说明里 Step 9 的小节编号是 9.1、9.3、9.4、9.5(没有 9.2,是原文的编号笔误)。内容是四件事:应用与部署、监控、维护、未来增强。照内容写,别照编号数。

这一章的一句话

这门课收的不是模型,是一条按九个编号排好的证据链;建模那三步只占 40%,而「解释」一步就占 20%——把力气按权重分配,比把力气全押在算法上高 10 分。

下一章回答一个你可能已经在想的问题:这九步是谁定的?它和你听过的 CRISP-DM、KDD、SEMMA 是什么关系?搞清楚这件事有个实际好处——你会知道在报告的方法论一节该引谁的论文。