研究论文(17%)、数据伦理、GenAI 边界与交付清单
最后一份交付,第 13 周(10 月 30 日),10–20 页单倍行距、11 号字、APA 7。它的要求列了九项 (a) 到 (i)——而这九项和九步几乎一一对应,所以如果你前面三次迭代都按编号写了,这篇论文主要是缝合、补文献、补 Step 9。这一章给出映射表、页数分配、伦理与 GenAI 的写法,以及最后那张清单。
论文的九项 ↔ 九步
| 论文要求 | 对应 | 页数建议 | 注意 |
|---|---|---|---|
| (a) 实际问题 practical problem | Step 1.1 | 0.5–1 | 真实世界的问题:SDG 现状、谁在受影响、现行做法为什么不够 |
| (b) 研究问题 research problem | 1.1 → 1.3 之间 | 0.3 | 这一项最容易漏。研究问题是学术表述:「能否用公开的社会经济指标可靠地识别未达标地区,从而支持资源优先级排序?」 |
| (c) 研究目标 research objectives | Step 1.3 | 0.3 | 编号列出 3–4 条(RO1、RO2……),后面结论要逐条回应 |
| (d) 文献 literature | 新增 | 2–3 | 这是论文相对迭代报告最大的增量。见下 |
| (e) 研究方法论 methodology | 第 2 章那段 | 1–1.5 | CRISP-DM × KDD 的综合+为什么、迭代结构、四条技术栈的设计 |
| (f) 数据到洞察的过程设计 | Step 2–4 | 3–4 | 数据来源、质量、清洗、构造、变换。压缩表格,别贴大段代码 |
| (g) 实现描述 implementation | Step 5–7 | 3–4 | 方法选择的讨论、算法与参数、测试设计、三条产线的对比 |
| (h) 结果与模式的解释 | Step 8 | 3–4 | 混淆矩阵、ROC、增益表、四句话解释、局限性 |
| (i) 基于发现的行动建议 | Step 9 | 1.5–2 | 部署、监控、维护、增强(第 21 章四段模板) |
加上标题页、摘要、参考文献、附录,正好落在 10–20 页。如果你写超了 20 页,砍的是 (f) 里的截图和 (g) 里的代码——把它们移到附录。
这是论文里唯一需要从零写的部分,也是最容易拿分的部分——因为结构可以固定:
- 问题域文献(3–4 篇):别人怎么研究这个 SDG 问题?用了什么指标?发现了什么?
找法:Google Scholar 搜「under-five mortality determinants machine learning」,或在 UoA 图书馆搜你的 SDG 主题 + prediction。 - 方法论文献(2–3 篇):Fayyad et al. (1996)、CRISP-DM (SPSS, 2007),加一篇讨论数据挖掘流程比较的。
- 技术文献(3–4 篇):你用的算法与技术。课程教材 Dean (2014) 正好覆盖大数据与机器学习的技术全景,Marr (2016) 的 45 个案例适合引一到两个和你主题相近的。两本都能从 UoA 图书馆免费下载。
每篇写两三句:它做了什么、发现了什么、和你的研究什么关系(相同点/你补上了什么)。最后用一段话收尾:「综上,既有研究多集中于 X,较少讨论 Y;本研究通过 Z 补充这一空白。」——这句「研究空白」的话是论文和作业报告的分界线。
参考写作范式:课程大纲点名了 Decision Support Systems 与 Journal of Big Data 两份期刊作为范文来源。去翻一篇最近的文章看它的结构(尤其是 Introduction 怎么从实际问题过渡到研究问题),二十分钟的投入会改变你整篇论文的气质。
APA 7 的五个必做项
| 项 | 做法 |
|---|---|
| 正文引用 | (Fayyad et al., 1996) 或 Fayyad et al. (1996) 指出……。三位及以上作者一律 et al.(APA 7 的变化) |
| 参考文献表 | 悬挂缩进,按作者姓氏字母序,期刊名与卷号斜体,尽量给 DOI |
| 表与图 | 表在上方标 Table 1 + 斜体标题;图在下方标 Figure 1 + 标题。正文里必须提到每一个表和图(「如表 3 所示」) |
| 数据集引用 | 数据也要进参考文献表:机构 (年). 数据集名 [Data set]. URL |
| 工具引用 | 软件版本写进方法一节(Python 3.x、scikit-learn x.x、Spark x.x、SPSS Modeler 版本)。可复现性评分项 |
UoA 图书馆的 APA 7 指南(auckland.libguides.com/apa7th)是课程指定的参考,Zotero 或 Mendeley 能自动生成大部分格式——花半小时装一个,比手改二十条引用快。
数据伦理:第 12 周那一讲,写进论文的四个维度
课程第 12 周专门讲 Data Ethics,而毕业生能力里有 8. Ethics and Professionalism 与 1.1 责任公民。这意味着论文里有一段伦理讨论是被期待的。四个维度,各两三句:
| 维度 | 问自己 | 本例的写法 |
|---|---|---|
| 隐私与同意 | 数据涉及个人吗?聚合到什么粒度? | 「本研究使用地区级聚合数据,不含个人可识别信息;若未来细化到设施-月粒度,需评估重识别风险并遵循相应审批流程。」 |
| 偏差与公平 | 谁在数据里缺席?模型会系统性亏待谁? | 这里直接回收第 9 章的发现:「literacy 的缺失为非随机(低识字率地区更易缺失),若采用整行删除会系统性排除最贫困地区,使模型低估其风险。本研究因此采用分组填补,并在 8.4 报告该偏差的方向。」 |
| 透明与可解释 | 决策对象能理解为什么自己被这样排序吗? | 「模型输出附带贡献最大的三个特征;同时提供决策树的规则集(8.3),使非技术人员可审阅判定逻辑。」 |
| 责任与人在环内 | 出错了谁负责?模型能自动执行决策吗? | 「模型仅提供排序建议,最终名单由人工复核确定(9.1);阈值作为可调参数交由决策者,而非固定在代码中。」 |
毕业生能力 1.2 明确提到应用 kaupapa Māori、Te Tiriti o Waitangi 与 mātauranga Māori。如果你的数据涉及新西兰(尤其涉及 Māori 人口的健康、教育、住房数据),这里有一段实打实可写的内容:
Māori data sovereignty(Māori 数据主权)主张:关于 Māori 的数据应由 Māori 参与治理,遵循 Te Mana Raraunga 提出的原则。写法示例:「本研究若使用涉及 Māori 人口的细分数据,应遵循 Māori 数据主权原则,与相关 iwi/hapū 建立治理安排,并确保分析目的与受影响社群的优先事项一致;本研究目前仅使用国家级聚合公开数据,故不涉及该层面的授权,但在 9.4 提出的粒度细化中必须先行处理。」
不要硬套。如果你的数据完全与新西兰无关(比如某非洲国家的 WHO 数据),就写对应语境下的社群同意与本地治理问题——重点是展示你知道「数据关于谁,谁就该有发言权」这个原则。
生成式 AI:边界在哪
课程第 10 周有一讲 GenAI,同时学术诚信条款明确要求「提交的作业必须是学生自己的作品,反映其学习」,并且会用检测工具审查。这两件事不矛盾,但你需要知道界线在哪。
| 用途 | 一般可接受 | 风险 |
|---|---|---|
| 让它解释一个概念(「什么是 PSI」) | ✓ 相当于查资料 | 可能给出错误或过时的内容,要用课程材料或文献核对 |
| 让它改英文语法 | ✓ 多数机构接受,但要按要求申报 | 过度润色会让文风与你平时差异明显 |
| 让它帮你 debug 一段代码 | ✓ 与查 Stack Overflow 类似 | 你必须能解释那段代码在做什么 |
| 让它替你写报告的分析与解释 | ✗ | 这是学术不端。而且 Step 8 恰恰考的是你的判断——代写的解释在被追问时会立刻崩 |
| 让它编造数字、引用或结果 | ✗✗ | 模型会生成看起来合理的假引用。每一条引用都要自己在图书馆能查到 |
三条可操作的规矩:① 以课程与 Canvas 上的最新要求为准(GenAI 政策在各校各课都在变,且大纲会明确说明本课的规定);② 不确定就申报——写一句「本文的语言润色部分使用了生成式 AI 工具,分析、代码与结论由作者完成」比事后被问强得多;③ 所有数字必须来自你自己跑出来的输出。这门课的每个数字都能追回一次执行,这既是防线也是习惯。
最后:交付自检
下面这张清单按九步逐格勾。它会算出你还有多少分处在风险里——按权重排序,告诉你先补哪一格:
- □ 报告的小标题用九步编号,每个编号下都有内容(含「不适用 + 理由」)
- □ 模型真的能跑:SPSS 流重新打开无报错 / Notebook 从头到尾 Run All 通过
- □ 每张图表都有编号,且正文里被引用过
- □ 所有指标标明是测试集上的,并写了划分方式与随机种子
- □ 有基线对比(全猜多数类 / 现行做法)
- □ 泄漏两句:3.1 的排除声明、7.1 的「统计量仅从训练集估计」
- □ Step 8 有阈值或代价的讨论,不只是默认 0.5
- □ Step 8.5 有迭代记录(至少一次回溯,含指标前后对比)
- □ 局限性单独成段,且不只是客套(指出方向:会低估谁、外推到哪里不行)
- □ APA 引用格式一致;数据集与软件版本都在参考文献或方法一节
- □ 文件名含姓名与迭代号;提交物齐全(报告 PDF + 流/Notebook + 数据说明或链接)
- □ 提交时间:上午 11:59,不是晚上——这门课六个 deadline 全部是 11:59 AM
最后一条每年都有人踩。把日历提醒设在前一天晚上。
这本书的一句话
你交的不是模型,是一条按九个编号排好的证据链。
The deliverable is not a model. It is a traceable chain of evidence, numbered 1 to 9.
把这本书压成能带走的六句话:
- 分不在模型里。建模三步占 40%,而「解释」一步占 20%、「数据准备」占 15%。按权重分配力气,比把力气全押在算法上高 10 分(第 1 章)。
- 1.1 的主语是人,1.3 的主语是一行数据。SDG 到数据挖掘目标之间必须经过「决策」这一层(第 5 章)。
- 先问「为什么缺」再问「怎么填」。非随机缺失下,整行删除会把你要找的那些地区删掉(第 9 章)。
- 指标好得反常时,先怀疑泄漏。98.6% 的准确率意味着答案躺在特征里(第 13 章)。
- 阈值 0.5 只是默认值。把它挪到 0.15,总代价从 99 降到 48——比换算法划算得多(第 18 章)。
- 四份数据可以有完全相同的统计量却长得完全不同。所以画图不是配图,是检验;而回归系数会因为共线性翻转符号,所以别把相关说成因果(第 20 章)。
九个工位走完了。现在回去把那份提案写完——它 0 分,但它决定后面 100 分怎么走。