情境评估、成本收益与项目计划:1.2 到 1.4 逐格填
Step 1 有四个小节,第 5 章处理了最难的 1.1 和 1.3。剩下的 1.2 和 1.4 是这门课最容易拿的分——因为 CRISP-DM 的官方指南把 1.2「Assess the situation」拆成了五个明确的子项,而作业说明沿用了它。你只要把这五格填满,这一小节就没有扣分点。多数人在这里失分,纯粹是因为不知道有这张清单。
1.2 的五格清单
CRISP-DM 把「评估情境」定义为五项产出物。逐格填,每格 3–6 行:
| 格 | 官方名 | 你要写什么 |
|---|---|---|
| ① | Inventory of resources | 资源盘点:数据(哪些表、多少行列、时间跨度)、软件(三条产线各自的版本与访问方式)、算力(笔记本规格、EC2 实例类型)、人(就你一个,这也要写)、专家(课程 tutor、领域文献)。 |
| ② | Requirements, assumptions and constraints | 要求、假设、约束三样分开写。要求=交付时间与格式;假设=你相信但没验证的事;约束=硬边界(数据许可、预算、机房时段)。 |
| ③ | Risks and contingencies | 风险 + 应对,成对出现。「AWS 环境不通 → 第 8 周提前搭好并存 README;若仍不通,改用本地 Spark 单机模式并说明差异」。 |
| ④ | Terminology | 术语表:业务词汇 ↔ 数据列名 双向对照。这一格最容易漏,也最容易给人好印象。 |
| ⑤ | Costs and benefits | 成本收益:做这件事花多少、省多少。可以是估算,但必须有单位和算式。 |
② 那三样必须分开写
「假设」是这一格的灵魂,因为它是你唯一可以合法地把数据的毛病提前免责的地方。举例:
1.2.2 Requirements, assumptions and constraints 要求 · 四次迭代分别在第 2/5/8/11 周提交,研究论文第 13 周提交。 · 模型必须可执行(Step 7.2),提交物含可重跑的流程文件/Notebook。 假设(未经验证,但本研究据此进行) A1 各地区的上报口径在 2015–2023 年间保持一致。若 2019 年后 统计定义发生变化,趋势项会被污染(在 8.4 中检验:分年度 残差是否存在系统性偏移)。 A2 疫苗覆盖率的缺失(999 哨兵值)为「未测量」而非「覆盖率为零」, 依据是该值超出取值域 [0,100]。 A3 女性识字率的缺失并非完全随机(低识字率地区更易缺失), 因此采用分组填补而非整行删除(见 3.2)。 A4 目标阈值 25‰ 在整个观测期内固定,不随年份调整。 约束 · 数据许可:CC BY 4.0,可用于学术研究,需标注来源。 · SPSS Modeler 仅可通过校园机房/远程桌面访问。 · AWS 使用课程提供的额度,实例需在不用时关闭。
看 A1 和 A3:它们各自都指向了后面某一步的具体动作(8.4 的残差检验、3.2 的分组填补)。这是「证据链」在 Step 1 里的样子——假设不是免责声明,是待办事项。
④ 术语表:一格换一个专业印象
这一格的作用是把业务语言和数据列名对齐。写起来五分钟,效果立竿见影,因为它同时解决了三个后续麻烦:Step 8 解释时不用反复说「也就是那个 u5mr 列」;论文里读者知道你在说什么;四条产线的字段命名保持一致。
| 业务术语 | 数据列 | 定义与单位 |
|---|---|---|
| 5 岁以下儿童死亡率(U5MR) | u5mr | 每 1 000 活产中 5 岁前死亡的人数(‰)。SDG 指标 3.2.1。 |
| 未达标 | risk = 'high' | u5mr > 25。阈值来自 SDG 3.2 的目标值。 |
| 医生密度 | doctors | 每 1 000 人口的执业医师数(人/千人)。 |
| 疫苗覆盖率 | vaccine | 适龄儿童完成基础免疫的百分比(%)。值 999 表示未测量。 |
| 上报死亡率 | rate_reported | 卫生局上报表中的死亡率(整数)。与目标变量为同一事实的不同记录,不可用作特征(见 3.1)。 |
最后一行是重点。把泄漏列在术语表里就点名并写明「不可用作特征」,等于在 Step 1 就把第 13 章那个 98.6% 的坑填了,而且这句话会让评分员知道你懂行。
⑤ 成本收益:用一个算式,不用一段感慨
这一格不需要真实财务数据,需要的是一个有单位的算式和标注清楚的假设。模板:
1.2.5 Costs and benefits 成本 · 分析成本:约 80 人时(含四条工具线的实现与文档),按研究 助理 NZ$35/h 估算 ≈ NZ$2 800。 · 计算成本:EC2 t3.large 约 US$0.10/h × 20 h ≈ US$2(课程额度覆盖)。 · 部署成本:年度批量运行一次,无需常驻服务;维护估 8 人时/年。 收益(估算,依赖假设 B1–B2) B1 假设每年可投放的额外资源覆盖 15 个地区。 B2 假设现行「按人口平摊」的命中率约等于基础率(42%), 即 15 个名额中约 6 个投到确实未达标的地区。 · 模型按风险排序后,前 20% 名单的命中率为 100%、提升度 2.36 倍(见 8.2 增益表)。同样 15 个名额,预计命中 12–14 个, 即多覆盖 6–8 个未达标地区。 · 若一次有效干预可使该地区 U5MR 下降 2‰、年活产 1 000 例, 则每多覆盖一个地区约对应每年 2 例可避免的儿童死亡。 6 个地区 ≈ 12 例/年。 结论:分析成本为一次性数千纽币量级,收益为每年十余例可避免 死亡的量级。即使收益估算有数倍误差,量级差距依然成立。
那个 2.36 倍提升度和42% 基础率不是我拍的,是第 19 章的增益表在本书示例数据上真算出来的数(前 20% 的名单命中率 100%,累计覆盖 45.9% 的未达标地区)。意思是:等你做到 Step 8,回来把这两个数字换成你自己的,1.2.5 就自动变成一段有数据支撑的论证。
学生报告里最常见的两个极端:要么完全不写收益(丢分),要么写「本模型每年可为政府节省 340 万纽币」这种精确到万位的数(不可信)。
正确姿势是:把每个假设编号列出来,用区间或量级表达结论,并明确说「即使误差数倍,结论仍成立」。这是决策支持文献的标准写法,也是 Decision Support Systems 这类期刊里成本收益分析的常见形态——而课程大纲正好把那份期刊列为范文来源。
1.4 项目计划:把第 4 章那张表放进来
第 4 章已经给了完整的甘特 + 风险 + 关键路径 + 缓冲模板,这里只补三件在 1.4 里额外要点明的事:
- 每个阶段要标产出物,不能只标动作。「数据准备」不是产出物,「清洗日志 + 清洗前后描述统计对照表」是。
- 要标出工具与技术的初步评估。CRISP-DM 的 1.4 明确包含「initial assessment of tools and techniques」:一句「基于 1.3 的二分类目标,初步选定决策树与逻辑回归两类算法;决策树用于可解释性,逻辑回归用于系数方向的业务解读;将在 Step 6 用同一测试设计比较」——这句话同时给 1.4 和 Step 5 铺路。
- 要写迭代计划。你已经知道要迭代四遍,把它当成计划的一部分明说:「本项目按课程要求在四套技术栈上实现同一流程,Step 1–2、5 在四次迭代间保持一致,Step 3–4、6–8 按各栈特性重新实现,并在第四次迭代中加入跨栈结果对比。」
提案只要 Step 1–2。按上面这些模板填完,篇幅大致是:1.1 半页、1.2 两页(五格)、1.3 半页、1.4 一页、2.1 半页、2.2 一页半(含数据字典表)、2.3 一页半(含 3–4 张图)、2.4 一页(质量清单)。合计 8 页上下,其中至少一半是表格和图。
如果你的提案里图表少于 5 个,多半是把该列表的东西写成了段落。这门课的报告不奖励散文。
1. Step 1.2 的五个小节,逐格填:资源盘点表、要求/假设(编号 A1…)/约束、风险应对表(成对)、术语表、成本收益(编号假设 B1…+算式+量级结论)。
2. Step 1.4:甘特表(第 4 章模板)+ 工具与技术初步评估一段 + 迭代计划一段。
3. 把假设编号留在报告里。后面每一步凡是依赖某个假设,就写「据 A3」。这是让整份报告读起来像研究而不像作业的最省力的技巧。
这一章的一句话
1.2 有一份 CRISP-DM 给的五格清单:资源、要求与假设与约束、风险与应对、术语表、成本收益——填满就没有扣分点;其中「假设」要编号并各自指向后面某一步的具体动作,「术语表」顺手把泄漏列点名,「成本收益」给量级不给小数点。
下一章开始 Step 2:数据。第一件事不是画图,是把这份数据的身份证信息写清楚——它从哪来、什么许可、一行是什么、共有几行几列。