卷 I · 立案CH 04工位 04/24

十三周:六个 deadline 和它们的真实成本

工位 STEP 1.4 产出项目计划 10% 的一部分 评分员在找:一份带时间、带产出物、带风险的计划——不是「我会按时完成」这种句子。一张甘特图 + 一个风险登记表就够了。

课程大纲给了一个很有用的数字:这门课设计为 150 学时,其中 24 小时讲座、24 小时实验课、30 小时阅读、72 小时作业。72 小时要分给四次迭代 + 一篇论文 + 25 小时 DataCamp——等一下,DataCamp 自己就要 25 小时。也就是说真正留给四份报告的,官方口径下只有 47 小时。这一章的目的就是让你在开学第二周就看清这笔预算。

倒计时工时预算项目计划甘特图

先看表,再谈感受

下面这张表是实时算的——它按你打开这一页的时间,算出每个 deadline 还剩几天:

三个结构性事实,从表里直接读出来:

  • 提案到 ISAS 只有三周(7 月 31 日 → 8 月 21 日)。而 ISAS 那次要交 Step 1–8 的完整报告,还要在一门你从没用过的软件里搭出能跑的流。
  • ISAS 到 OSAS 中间隔着 mid-semester break(第 6–7 周之间),日历上是五周,实际可用时间被假期切开。这是唯一一段可以喘气的时间,也是补 DataCamp 的最佳窗口
  • OSAS 到 BDAS 三周,BDAS 到论文两周。最后两周你要同时做完 BDAS 报告和一篇 10–20 页 APA 论文。这是整学期唯一真正会翻车的地方。

72 小时怎么花:一份工时估算

下面的估算基于「一个会写代码、但没用过 SPSS Modeler 和 PySpark 的人」。如果你 pandas 熟,OSAS 那栏可以砍半;如果你从没开过 EC2,BDAS 那栏要加 3 小时。

阶段做什么估时说明
提案选题、找数据、Step 1–2 全写6–8 h找数据最花时间。数据一天找不到就换题,不要在这里耗一周。
Iteration 2 ISAS学 Modeler + 搭流 + 写 Step 3–814–18 h软件学习占 5 h。报告是母版,写工整。
DataCamp25 小时以上25 h可挂机式推进,每周 2.5 h × 10 周。别攒到第 7 周。
Iteration 3 OSASPython + Weka/Kettle/Tableau + 改报告10–14 hStep 1–2、5 直接复用;工具多,把每个工具的截图当证据攒好。
Iteration 4 BDASEC2 + SSH + PySpark + 改报告12–16 h环境风险最高的一次。第 8 周实验课之后立刻把环境跑通,别等到第 10 周。
研究论文10–20 页,APA,Step 1–910–14 h如果三份迭代报告写得好,这里主要是缝合 + 补文献 + 补 Step 9
合计77–95 h比官方的 72 h 略高,属正常。

最重要的一行是论文那 10–14 小时。它的实际耗时几乎完全取决于前面三份报告的质量:如果每次迭代你都老实写了 Step 8 的解释和 8.5 的迭代记录,论文就是把三份缝起来、加一节文献综述、补上 Step 9;如果前三次都在赶工,论文等于从零写。这是这门课最大的复利。

◆ 一条反直觉的建议:Step 9 现在就写

Step 9(部署、监控、维护、增强)在四次迭代里不单独计分,只在论文里要求。所以大部分人会留到最后两周写——而那正是最忙的两周。

但 Step 9 是全课最不依赖数据和代码的一步:它问的是「如果这个模型真的要用起来,谁来用、多久重训、怎么发现它坏了」。这些问题在第 2 周就能想清楚,而且想清楚之后会反过来改进你的 Step 1(因为你会发现有些目标根本无法部署)。建议在提案阶段就写一段 200 字的 Step 9 草稿,之后每次迭代补充一点。第 21 章会给你具体的监控指标(PSI)和一张真实的模型退化表。

逆推排期:从今天到 10 月 30 日

下面这份排期是按「每周投入 6–8 小时」设计的,把风险都往前压:

主要动作本周必须产出
第 2 周
(本周)
定 SDG + 决策场景 → 找数据 → 跑一遍 Step 2 的描述与质量检查 → 写 Step 1–2提案(7/31 前)。外加一件事:把数据集存成本地副本并记下下载日期与 URL(Step 2.1 要)。
第 3–4 周实验课跟着做 ISAS;同时把 Step 3–4 的清洗逻辑先在 Python 里想清楚(用你熟的工具想问题,用陌生的工具实现一条能跑通的 SPSS 流 + Step 3–4 草稿。每周 2.5 h DataCamp。
第 5 周ISAS 建模、评估、写 Step 5–8Iteration 2(8/21 前)。提交前 Restart & Run All 式的全流程重跑。
BreakDataCamp 冲刺 + 把 ISAS 报告改成母版(编号、图表编号、引用格式)DataCamp 过 20 h。母版定稿。
第 7–8 周OSAS:Python 主线 + Tableau 出图 + Weka/Kettle 各留一处证据DataCamp(9/14 前)Iteration 3(9/25 前)
第 8 周
(关键)
实验课当天就把 EC2 + SSH + PySpark 环境跑通,跑一个 count() 截图存证一个能连上的实例 + 一个跑通的 notebook。这一步提前三周做,是整学期最值的保险。
第 9–11 周BDAS:把 OSAS 的流程翻译成 PySpark,记录分区、shuffle、耗时Iteration 4(10/16 前) + 一节「三条产线结果对比」。
第 12–13 周论文:缝合三份报告 + 文献综述 + Step 9 + APA 格式检查研究论文(10/30 前)
⚠ 三个具体的翻车点,和各自的止损

1. AWS 环境在第 10 周才第一次尝试。止损:第 8 周实验课当天跑通,把 SSH 命令、密钥文件、AMI 名称、安全组设置写成一份自己的 README。EC2 实例记得关(费用);关掉之后公有 IP 会变,README 里留一行提醒。

2. SPSS Modeler 只在学校机房有。止损:第 3 周就确认你的访问方式(校园机房/远程虚拟桌面/自己的授权)。如果只能在机房用,所有截图当场存好,别指望回家补。

3. 数据集在第 6 周被你自己换掉。这是最贵的一种翻车——意味着 ISAS 那次的 Step 2–4 全作废。止损:提案阶段就把六条自检(第 3 章)过一遍,尤其确认目标列真的存在、缺失率不到 40%

Step 1.4 要的「项目计划」长什么样

不需要专业项目管理工具。一张甘特图 + 一个风险登记表,各占半页,就是满分答卷。甘特图可以直接用 Excel 的条形图或者 Markdown 表格画:

1.4 Project Plan

阶段                     周次   产出物                    风险
──────────────────────────────────────────────────────────────
数据获取与理解           2      清洗前描述统计、质量报告   数据许可不明 → 改用 WB 开放数据
数据准备与变换(ISAS)   3–4    SPSS 流、清洗日志          Modeler 仅机房可用 → 当场存截图
建模与解释(ISAS)       5      Iteration 2 报告           时间不足 → 先保 Step 8,参数调优放弃
开源栈复现(OSAS)       7–8    Notebook、Tableau 仪表板   工具分散 → 每工具留一处证据即可
大数据复现(BDAS)       9–11   EC2 环境、PySpark 作业     环境不通 → 第 8 周提前搭好并存 README
论文撰写                 12–13  10–20 页 APA               前期报告不完整 → 每次迭代即时写 8.5

关键路径:数据集选定 → ISAS 报告(后续两次的母版)→ 论文
缓冲:每个 deadline 前留 2 天,用于全流程重跑与格式检查

注意最后两行。「关键路径」和「缓冲」这两个词是项目计划的及格线——它们证明你不是把任务列了个表,而是想过依赖关系。

▣ 本章交付物 —— 报告里放什么

1. Step 1.4:上面那张表(甘特 + 风险 + 关键路径 + 缓冲)。四份报告通用,只需每次更新「已完成」标记。

2. 一份属于你自己的 README(不进报告,但救命):数据集 URL 与下载日期、SPSS 访问方式、EC2 实例类型/AMI/SSH 命令、各工具版本号。版本号在论文里是要写的(可复现性),现在记比最后翻记忆便宜。

3. 日历事件:六个 deadline,每个提前 2 天设提醒。DataCamp 设成每周重复。

这一章的一句话

72 小时的作业预算里有 25 小时属于 DataCamp,真正留给四份报告的只有四十多小时;而最后两周要同时交 BDAS 和论文——所以第一份报告写成可复用的母版、第 8 周就把 AWS 环境跑通、Step 9 现在就起草,这三件事决定你 10 月底的状态。

卷 I 结束。下一卷是这周就要用的东西:Step 1 和 Step 2,也就是那份 0 分但决定一切的提案。第 5 章从最难的一件事开始——把一个 SDG 变成一个能被数据回答的问题。