卷 VI · 交付CH 24工位 24/24

研究论文(17%)、数据伦理、GenAI 边界与交付清单

工位 论文 + 收尾 Steps 1–9 全写一遍 17% 评分员在找:一篇像期刊文章的东西——有实际问题、有研究问题、有文献、有方法、有结果、有行动建议。不是把三份迭代报告钉在一起。

最后一份交付,第 13 周(10 月 30 日),10–20 页单倍行距、11 号字、APA 7。它的要求列了九项 (a) 到 (i)——而这九项和九步几乎一一对应,所以如果你前面三次迭代都按编号写了,这篇论文主要是缝合、补文献、补 Step 9。这一章给出映射表、页数分配、伦理与 GenAI 的写法,以及最后那张清单。

论文九项APA 7数据伦理GenAI交付清单

论文的九项 ↔ 九步

论文要求对应页数建议注意
(a) 实际问题 practical problemStep 1.10.5–1真实世界的问题:SDG 现状、谁在受影响、现行做法为什么不够
(b) 研究问题 research problem1.1 → 1.3 之间0.3这一项最容易漏。研究问题是学术表述:「能否用公开的社会经济指标可靠地识别未达标地区,从而支持资源优先级排序?」
(c) 研究目标 research objectivesStep 1.30.3编号列出 3–4 条(RO1、RO2……),后面结论要逐条回应
(d) 文献 literature新增2–3这是论文相对迭代报告最大的增量。见下
(e) 研究方法论 methodology第 2 章那段1–1.5CRISP-DM × KDD 的综合+为什么、迭代结构、四条技术栈的设计
(f) 数据到洞察的过程设计Step 2–43–4数据来源、质量、清洗、构造、变换。压缩表格,别贴大段代码
(g) 实现描述 implementationStep 5–73–4方法选择的讨论、算法与参数、测试设计、三条产线的对比
(h) 结果与模式的解释Step 83–4混淆矩阵、ROC、增益表、四句话解释、局限性
(i) 基于发现的行动建议Step 91.5–2部署、监控、维护、增强(第 21 章四段模板)

加上标题页、摘要、参考文献、附录,正好落在 10–20 页。如果你写超了 20 页,砍的是 (f) 里的截图和 (g) 里的代码——把它们移到附录。

◆ (d) 文献综述:三类文献,各三到四篇

这是论文里唯一需要从零写的部分,也是最容易拿分的部分——因为结构可以固定:

  1. 问题域文献(3–4 篇):别人怎么研究这个 SDG 问题?用了什么指标?发现了什么?
    找法:Google Scholar 搜「under-five mortality determinants machine learning」,或在 UoA 图书馆搜你的 SDG 主题 + prediction。
  2. 方法论文献(2–3 篇):Fayyad et al. (1996)、CRISP-DM (SPSS, 2007),加一篇讨论数据挖掘流程比较的。
  3. 技术文献(3–4 篇):你用的算法与技术。课程教材 Dean (2014) 正好覆盖大数据与机器学习的技术全景,Marr (2016) 的 45 个案例适合引一到两个和你主题相近的。两本都能从 UoA 图书馆免费下载。

每篇写两三句:它做了什么、发现了什么、和你的研究什么关系(相同点/你补上了什么)。最后用一段话收尾:「综上,既有研究多集中于 X,较少讨论 Y;本研究通过 Z 补充这一空白。」——这句「研究空白」的话是论文和作业报告的分界线。

参考写作范式:课程大纲点名了 Decision Support SystemsJournal of Big Data 两份期刊作为范文来源。去翻一篇最近的文章看它的结构(尤其是 Introduction 怎么从实际问题过渡到研究问题),二十分钟的投入会改变你整篇论文的气质。

APA 7 的五个必做项

做法
正文引用(Fayyad et al., 1996) 或 Fayyad et al. (1996) 指出……。三位及以上作者一律 et al.(APA 7 的变化)
参考文献表悬挂缩进,按作者姓氏字母序,期刊名与卷号斜体,尽量给 DOI
表与图表在上方标 Table 1 + 斜体标题;图在下方标 Figure 1 + 标题。正文里必须提到每一个表和图(「如表 3 所示」)
数据集引用数据也要进参考文献表:机构 (年). 数据集名 [Data set]. URL
工具引用软件版本写进方法一节(Python 3.x、scikit-learn x.x、Spark x.x、SPSS Modeler 版本)。可复现性评分项

UoA 图书馆的 APA 7 指南(auckland.libguides.com/apa7th)是课程指定的参考,Zotero 或 Mendeley 能自动生成大部分格式——花半小时装一个,比手改二十条引用快。

数据伦理:第 12 周那一讲,写进论文的四个维度

课程第 12 周专门讲 Data Ethics,而毕业生能力里有 8. Ethics and Professionalism1.1 责任公民。这意味着论文里有一段伦理讨论是被期待的。四个维度,各两三句:

维度问自己本例的写法
隐私与同意数据涉及个人吗?聚合到什么粒度?「本研究使用地区级聚合数据,不含个人可识别信息;若未来细化到设施-月粒度,需评估重识别风险并遵循相应审批流程。」
偏差与公平谁在数据里缺席?模型会系统性亏待谁?这里直接回收第 9 章的发现:「literacy 的缺失为非随机(低识字率地区更易缺失),若采用整行删除会系统性排除最贫困地区,使模型低估其风险。本研究因此采用分组填补,并在 8.4 报告该偏差的方向。」
透明与可解释决策对象能理解为什么自己被这样排序吗?「模型输出附带贡献最大的三个特征;同时提供决策树的规则集(8.3),使非技术人员可审阅判定逻辑。」
责任与人在环内出错了谁负责?模型能自动执行决策吗?「模型仅提供排序建议,最终名单由人工复核确定(9.1);阈值作为可调参数交由决策者,而非固定在代码中。」
✎ 一个 UoA 语境下的加分点:数据主权

毕业生能力 1.2 明确提到应用 kaupapa Māori、Te Tiriti o Waitangi 与 mātauranga Māori。如果你的数据涉及新西兰(尤其涉及 Māori 人口的健康、教育、住房数据),这里有一段实打实可写的内容:

Māori data sovereignty(Māori 数据主权)主张:关于 Māori 的数据应由 Māori 参与治理,遵循 Te Mana Raraunga 提出的原则。写法示例:「本研究若使用涉及 Māori 人口的细分数据,应遵循 Māori 数据主权原则,与相关 iwi/hapū 建立治理安排,并确保分析目的与受影响社群的优先事项一致;本研究目前仅使用国家级聚合公开数据,故不涉及该层面的授权,但在 9.4 提出的粒度细化中必须先行处理。」

不要硬套。如果你的数据完全与新西兰无关(比如某非洲国家的 WHO 数据),就写对应语境下的社群同意与本地治理问题——重点是展示你知道「数据关于谁,谁就该有发言权」这个原则。

生成式 AI:边界在哪

课程第 10 周有一讲 GenAI,同时学术诚信条款明确要求「提交的作业必须是学生自己的作品,反映其学习」,并且会用检测工具审查。这两件事不矛盾,但你需要知道界线在哪。

用途一般可接受风险
让它解释一个概念(「什么是 PSI」)✓ 相当于查资料可能给出错误或过时的内容,要用课程材料或文献核对
让它改英文语法✓ 多数机构接受,但要按要求申报过度润色会让文风与你平时差异明显
让它帮你 debug 一段代码✓ 与查 Stack Overflow 类似你必须能解释那段代码在做什么
让它替你写报告的分析与解释这是学术不端。而且 Step 8 恰恰考的是你的判断——代写的解释在被追问时会立刻崩
让它编造数字、引用或结果✗✗模型会生成看起来合理的假引用。每一条引用都要自己在图书馆能查到

三条可操作的规矩:以课程与 Canvas 上的最新要求为准(GenAI 政策在各校各课都在变,且大纲会明确说明本课的规定);② 不确定就申报——写一句「本文的语言润色部分使用了生成式 AI 工具,分析、代码与结论由作者完成」比事后被问强得多;③ 所有数字必须来自你自己跑出来的输出。这门课的每个数字都能追回一次执行,这既是防线也是习惯。

最后:交付自检

下面这张清单按九步逐格勾。它会算出你还有多少分处在风险里——按权重排序,告诉你先补哪一格:

▣ 每次提交前的 12 项通用检查
  1. □ 报告的小标题用九步编号,每个编号下都有内容(含「不适用 + 理由」)
  2. 模型真的能跑:SPSS 流重新打开无报错 / Notebook 从头到尾 Run All 通过
  3. □ 每张图表都有编号,且正文里被引用过
  4. □ 所有指标标明是测试集上的,并写了划分方式与随机种子
  5. □ 有基线对比(全猜多数类 / 现行做法)
  6. □ 泄漏两句:3.1 的排除声明、7.1 的「统计量仅从训练集估计」
  7. □ Step 8 有阈值或代价的讨论,不只是默认 0.5
  8. □ Step 8.5 有迭代记录(至少一次回溯,含指标前后对比)
  9. □ 局限性单独成段,且不只是客套(指出方向:会低估谁、外推到哪里不行)
  10. □ APA 引用格式一致;数据集与软件版本都在参考文献或方法一节
  11. □ 文件名含姓名与迭代号;提交物齐全(报告 PDF + 流/Notebook + 数据说明或链接)
  12. □ 提交时间:上午 11:59,不是晚上——这门课六个 deadline 全部是 11:59 AM

最后一条每年都有人踩。把日历提醒设在前一天晚上。

这本书的一句话

全 书 结 论

你交的不是模型,是一条按九个编号排好的证据链。

The deliverable is not a model. It is a traceable chain of evidence, numbered 1 to 9.

把这本书压成能带走的六句话:

  1. 分不在模型里。建模三步占 40%,而「解释」一步占 20%、「数据准备」占 15%。按权重分配力气,比把力气全押在算法上高 10 分(第 1 章)。
  2. 1.1 的主语是人,1.3 的主语是一行数据。SDG 到数据挖掘目标之间必须经过「决策」这一层(第 5 章)。
  3. 先问「为什么缺」再问「怎么填」。非随机缺失下,整行删除会把你要找的那些地区删掉(第 9 章)。
  4. 指标好得反常时,先怀疑泄漏。98.6% 的准确率意味着答案躺在特征里(第 13 章)。
  5. 阈值 0.5 只是默认值。把它挪到 0.15,总代价从 99 降到 48——比换算法划算得多(第 18 章)。
  6. 四份数据可以有完全相同的统计量却长得完全不同。所以画图不是配图,是检验;而回归系数会因为共线性翻转符号,所以别把相关说成因果(第 20 章)。

九个工位走完了。现在回去把那份提案写完——它 0 分,但它决定后面 100 分怎么走。