卷 II · 立题CH 06工位 06/24

情境评估、成本收益与项目计划:1.2 到 1.4 逐格填

工位 STEP 1.2 / 1.4 评估情境 · 产出项目计划 10% 的另一半 评分员在找:五个具体的清单(资源、假设与约束、风险、术语、成本收益),不是一段「本项目具有重要意义」的抒情。

Step 1 有四个小节,第 5 章处理了最难的 1.1 和 1.3。剩下的 1.2 和 1.4 是这门课最容易拿的分——因为 CRISP-DM 的官方指南把 1.2「Assess the situation」拆成了五个明确的子项,而作业说明沿用了它。你只要把这五格填满,这一小节就没有扣分点。多数人在这里失分,纯粹是因为不知道有这张清单。

Step 1.2假设与约束风险登记术语表成本收益

1.2 的五格清单

CRISP-DM 把「评估情境」定义为五项产出物。逐格填,每格 3–6 行:

官方名你要写什么
Inventory of resources资源盘点:数据(哪些表、多少行列、时间跨度)、软件(三条产线各自的版本与访问方式)、算力(笔记本规格、EC2 实例类型)、人(就你一个,这也要写)、专家(课程 tutor、领域文献)。
Requirements, assumptions and constraints要求、假设、约束三样分开写。要求=交付时间与格式;假设=你相信但没验证的事;约束=硬边界(数据许可、预算、机房时段)。
Risks and contingencies风险 + 应对,成对出现。「AWS 环境不通 → 第 8 周提前搭好并存 README;若仍不通,改用本地 Spark 单机模式并说明差异」。
Terminology术语表:业务词汇 ↔ 数据列名 双向对照。这一格最容易漏,也最容易给人好印象。
Costs and benefits成本收益:做这件事花多少、省多少。可以是估算,但必须有单位和算式。

② 那三样必须分开写

「假设」是这一格的灵魂,因为它是你唯一可以合法地把数据的毛病提前免责的地方。举例:

1.2.2 Requirements, assumptions and constraints

要求
· 四次迭代分别在第 2/5/8/11 周提交,研究论文第 13 周提交。
· 模型必须可执行(Step 7.2),提交物含可重跑的流程文件/Notebook。

假设(未经验证,但本研究据此进行)
A1 各地区的上报口径在 2015–2023 年间保持一致。若 2019 年后
   统计定义发生变化,趋势项会被污染(在 8.4 中检验:分年度
   残差是否存在系统性偏移)。
A2 疫苗覆盖率的缺失(999 哨兵值)为「未测量」而非「覆盖率为零」,
   依据是该值超出取值域 [0,100]。
A3 女性识字率的缺失并非完全随机(低识字率地区更易缺失),
   因此采用分组填补而非整行删除(见 3.2)。
A4 目标阈值 25‰ 在整个观测期内固定,不随年份调整。

约束
· 数据许可:CC BY 4.0,可用于学术研究,需标注来源。
· SPSS Modeler 仅可通过校园机房/远程桌面访问。
· AWS 使用课程提供的额度,实例需在不用时关闭。

看 A1 和 A3:它们各自都指向了后面某一步的具体动作(8.4 的残差检验、3.2 的分组填补)。这是「证据链」在 Step 1 里的样子——假设不是免责声明,是待办事项。

④ 术语表:一格换一个专业印象

这一格的作用是把业务语言和数据列名对齐。写起来五分钟,效果立竿见影,因为它同时解决了三个后续麻烦:Step 8 解释时不用反复说「也就是那个 u5mr 列」;论文里读者知道你在说什么;四条产线的字段命名保持一致。

业务术语数据列定义与单位
5 岁以下儿童死亡率(U5MR)u5mr每 1 000 活产中 5 岁前死亡的人数(‰)。SDG 指标 3.2.1。
未达标risk = 'high'u5mr > 25。阈值来自 SDG 3.2 的目标值。
医生密度doctors每 1 000 人口的执业医师数(人/千人)。
疫苗覆盖率vaccine适龄儿童完成基础免疫的百分比(%)。值 999 表示未测量
上报死亡率rate_reported卫生局上报表中的死亡率(整数)。与目标变量为同一事实的不同记录,不可用作特征(见 3.1)。

最后一行是重点。把泄漏列在术语表里就点名并写明「不可用作特征」,等于在 Step 1 就把第 13 章那个 98.6% 的坑填了,而且这句话会让评分员知道你懂行。

⑤ 成本收益:用一个算式,不用一段感慨

这一格不需要真实财务数据,需要的是一个有单位的算式和标注清楚的假设。模板:

1.2.5 Costs and benefits

成本
· 分析成本:约 80 人时(含四条工具线的实现与文档),按研究
  助理 NZ$35/h 估算 ≈ NZ$2 800。
· 计算成本:EC2 t3.large 约 US$0.10/h × 20 h ≈ US$2(课程额度覆盖)。
· 部署成本:年度批量运行一次,无需常驻服务;维护估 8 人时/年。

收益(估算,依赖假设 B1–B2)
B1 假设每年可投放的额外资源覆盖 15 个地区。
B2 假设现行「按人口平摊」的命中率约等于基础率(42%),
   即 15 个名额中约 6 个投到确实未达标的地区。
· 模型按风险排序后,前 20% 名单的命中率为 100%、提升度 2.36
  倍(见 8.2 增益表)。同样 15 个名额,预计命中 12–14 个,
  即多覆盖 6–8 个未达标地区。
· 若一次有效干预可使该地区 U5MR 下降 2‰、年活产 1 000 例,
  则每多覆盖一个地区约对应每年 2 例可避免的儿童死亡。
  6 个地区 ≈ 12 例/年。

结论:分析成本为一次性数千纽币量级,收益为每年十余例可避免
死亡的量级。即使收益估算有数倍误差,量级差距依然成立。

那个 2.36 倍提升度42% 基础率不是我拍的,是第 19 章的增益表在本书示例数据上真算出来的数(前 20% 的名单命中率 100%,累计覆盖 45.9% 的未达标地区)。意思是:等你做到 Step 8,回来把这两个数字换成你自己的,1.2.5 就自动变成一段有数据支撑的论证。

◆ 收益估算的诚实姿势:给量级,不给小数点

学生报告里最常见的两个极端:要么完全不写收益(丢分),要么写「本模型每年可为政府节省 340 万纽币」这种精确到万位的数(不可信)。

正确姿势是:把每个假设编号列出来,用区间或量级表达结论,并明确说「即使误差数倍,结论仍成立」。这是决策支持文献的标准写法,也是 Decision Support Systems 这类期刊里成本收益分析的常见形态——而课程大纲正好把那份期刊列为范文来源。

1.4 项目计划:把第 4 章那张表放进来

第 4 章已经给了完整的甘特 + 风险 + 关键路径 + 缓冲模板,这里只补三件在 1.4 里额外要点明的事:

  • 每个阶段要标产出物,不能只标动作。「数据准备」不是产出物,「清洗日志 + 清洗前后描述统计对照表」是。
  • 要标出工具与技术的初步评估。CRISP-DM 的 1.4 明确包含「initial assessment of tools and techniques」:一句「基于 1.3 的二分类目标,初步选定决策树与逻辑回归两类算法;决策树用于可解释性,逻辑回归用于系数方向的业务解读;将在 Step 6 用同一测试设计比较」——这句话同时给 1.4 和 Step 5 铺路。
  • 要写迭代计划。你已经知道要迭代四遍,把它当成计划的一部分明说:「本项目按课程要求在四套技术栈上实现同一流程,Step 1–2、5 在四次迭代间保持一致,Step 3–4、6–8 按各栈特性重新实现,并在第四次迭代中加入跨栈结果对比。」
✎ 提案的篇幅感:Step 1–2 大约六到八页

提案只要 Step 1–2。按上面这些模板填完,篇幅大致是:1.1 半页、1.2 两页(五格)、1.3 半页、1.4 一页、2.1 半页、2.2 一页半(含数据字典表)、2.3 一页半(含 3–4 张图)、2.4 一页(质量清单)。合计 8 页上下,其中至少一半是表格和图。

如果你的提案里图表少于 5 个,多半是把该列表的东西写成了段落。这门课的报告不奖励散文。

▣ 本章交付物 —— 报告里放什么

1. Step 1.2 的五个小节,逐格填:资源盘点表、要求/假设(编号 A1…)/约束、风险应对表(成对)、术语表、成本收益(编号假设 B1…+算式+量级结论)。

2. Step 1.4:甘特表(第 4 章模板)+ 工具与技术初步评估一段 + 迭代计划一段。

3. 把假设编号留在报告里。后面每一步凡是依赖某个假设,就写「据 A3」。这是让整份报告读起来像研究而不像作业的最省力的技巧。

这一章的一句话

1.2 有一份 CRISP-DM 给的五格清单:资源、要求与假设与约束、风险与应对、术语表、成本收益——填满就没有扣分点;其中「假设」要编号并各自指向后面某一步的具体动作,「术语表」顺手把泄漏列点名,「成本收益」给量级不给小数点。

下一章开始 Step 2:数据。第一件事不是画图,是把这份数据的身份证信息写清楚——它从哪来、什么许可、一行是什么、共有几行几列。