CSYS5030 Information Theory Project 作业要求梳理
CSYS5030 Information Theory Project 作业要求梳理
课程:CSYS5030 — Information Theory and Self-Organisation,Semester 2 2026 来源:Canvas 三个 assignment 页面(Stage 1 Proposal / Stage 2 Presentation / Code submission point,含 rubric)+ 讨论区 Information theory project assignment - Q&A(助教 Alexander Richter 的 FAQ,9 月 16 日更新)+ 讨论区 Some open data sets 帖 + Unit Outline + Week 6/7 课上老师的口头说明 总分值:Proposal 20% + Presentation 40% = 期末总评的 60%
⚠️ 本文只整理作业要求与评分标准,不涉及具体选题和分析方案。
一、关键信息
全课程考核结构(Unit Outline)
| 考核 | 权重 | 时间 | 形式 | AI |
|---|---|---|---|---|
| Tutorial assessment(Early feedback task) | 0% | Week 3 | 60 分钟 | 禁止 |
| Project proposal | 20% | 9 月 30 日 23:59(关闭 10 月 10 日) | 1000 词 | 允许 |
| Project presentation | 40% | 11 月 8 日 23:59(关闭 11 月 18 日) | 10 分钟视频 | 允许 |
| Final exam | 40% | 考试周 | 1.5 小时笔试,hurdle(必须通过) | 禁止 |
期末考试是 hurdle task,题型包括选择题、计算题和简答题,覆盖全部内容——所以项目做得再好也不能忽视考试。
时间线
| 事项 | 截止 | 说明 |
|---|---|---|
| Stage 1 Proposal | 2026-09-30(周三)23:59 | 在期中假期里。Canvas 上放在 Module 9 之后,但实际截止在 Module 9 之前 |
| Proposal 用 simple extension | 老师课上说 10 月 5 日 | FAQ:simple extension 默认对所有人生效,不需要申请 |
| Proposal 关闭 | 10 月 10 日 23:59 | 页面写明 simple extension「以关闭日为限」 |
| Stage 2 Presentation(视频 + slides) | 2026-11-08(周日)23:59 | Week 13 末 |
| Code submission | 同上 11-08 23:59 | 单独的提交入口,不计分但必须交 |
迟交与延期
| 阶段 | Simple extension | 迟交 |
|---|---|---|
| Proposal | 有,默认生效,但不能超过关闭日 | 每迟一个自然日扣满分的 5%;迟交超过 10 天记 0 分 |
| Presentation | 没有! | 没有正式 Special Consideration 的迟交一律不接受 |
为什么 presentation 不给 simple extension:视频是发在讨论区的,晚交的人能先看到别人的作品,「会获得不公平的优势」。页面上 Nov 18 的「Available until」不代表可以迟交。
提交物一览
| 阶段 | 交什么 | 交到哪 | 格式 |
|---|---|---|---|
| Stage 1 | Proposal 文档 | Proposal assignment 页面 | DOC / DOCX / PDF |
| Stage 2 | ① 视频 | 讨论区里只有你能看到的那个「Project videos - Group X」论坛,作为新回复发帖 | Canvas Studio 上传 / YouTube 等链接 / Canvas 附件 |
| Stage 2 | ② Slides | Presentation assignment 页面 | PDF 优先(也收 PPT/PPTX);没用 slides 就交视频里一帧静态画面的 PDF |
| Stage 2 | ③ 代码 | Code submission point | 单个 PDF,文字必须可读、可搜索 |
不需要写报告(页面原文:There is no report required)。
AI 使用
- Unit Outline:proposal 和 presentation 都允许使用生成式 AI。
- 必须声明:写明用了哪个 AI
工具、在哪些地方怎么帮了忙。
- Proposal:AI 声明不计入字数。
- Presentation:可以放在提交的 PDF 里一页不播放的 slide 上。
- 必须保留记录:保存和 AI 的交互记录(prompt、回复、生成内容),老师可能要求出示以核实你自己的贡献。提交物、草稿、AI 输出和研究材料保留一年。
- 所有提交都过 Turnitin。
二、项目是什么
任务原文要点:对自己选择的数据集做信息论分析,选择合适的度量,回答关于该系统动态和/或关系的一个或多个问题。
两个阶段:
- Stage 1 — Proposal:说明要用的数据集和数据分析计划。
- Stage 2 — Video presentation:交付最终分析,要吸收 Stage 1 的反馈。讲清楚方法、结果、对所研究系统的意义,并批判性地评估自己的发现。
老师在 Week 6 课上强调:proposal 之前不提供个人化反馈——proposal 本身就是拿反馈的环节。所以动笔前先读 Stage 2 的要求,知道最终要走到哪里。
三、数据集
3.1 可以用的来源
- Module 8 文献阅读活动里文章用到的开放数据集
- 自己专业领域熟悉的数据
- 讨论区帖子里列的开放数据集,或者自己搜到的(Kaggle 等通用来源都可以随便用,不限于特定比赛)
- 自己跑复杂系统模拟生成的数据(比如 NetLogo 模型)
- 复现已有论文在开放数据集上的结果也可以,前提是符合任务要求,并且引用被复现的研究
- 已经被原作者预处理过的数据也可以,提一下原作者做了什么预处理,再说明你自己额外做的
3.2 ❌ 禁止使用:课上分析过的数据集
页面列出的(不完整清单,「etc.」):
Seinfeld 剧本、Scissors-Paper-Rock、Heart-Breath rates、MNIST、Ising model、Ant foraging、Elementary Cellular Automata、CoCoMac brain model……
- 原因(老师 Week 7 课上):课上经常说「在这个数据上你可以做 X 或 Y」,他不想看到 10 个人都做他随口提过的分析。FAQ 的说法是「分析等于已经演示给你看过了」。
- 例外:分析实质上完全不同时可能允许,但必须事先和 Unit Coordinator 确认,不要自己默认可以。
- 注意:开放数据集帖子里虽然列了 MNIST,但帖子自己也提醒要以作业页面为准——作业页面明确禁用了。
3.3 常见疑问(FAQ)
| 问题 | 官方答复 |
|---|---|
| 必须是时间序列吗? | 不必须。「dynamics of and relationships in」同时涵盖时间序列和静态横截面数据(比如风险因素与结果)。不要求用 transfer entropy 或任何时序专用度量 |
| 有最低样本量吗? | 没有固定下限,但度量的选择和解读的把握程度要和实际数据量匹配 |
| 要不要把数据集一起交? | 不要。proposal 里描述数据集并给出获取或生成链接;代码提交时也不要附数据 |
3.4 课上补充的判断标准
- 数据太短不合适:只有 10–15 个样本,「祝你好运能得到统计显著的结果」。
- 「10 个人」不等于 10 个样本:如果每个受试者都有很长的时间序列(比如 1000 个时间点),对每人各算一次 MI 完全没问题,10 个受试者相当于10 次重复实验。只有像「个人特征 vs 是否患病」这种每人一个样本的问题,10 个人才不够。
- 平稳性:用时间序列时要注意平稳。股价长期上涨是非平稳的:
- 老师课上建议:取每日(log)差值;
- 开放数据集帖子的建议:把原始值转成二值,表示该时间步是涨还是跌,平稳得多。
- 花时间认真挑数据集,不要抓到第一个就用。
3.5 在讨论区提问的规矩
- 通用问题发 Information theory project assignment - Q&A 帖,先查 FAQ 和已有回答再发;分享数据集要发在专门的数据集帖里。
- ❌ 不要问「我能用这个数据集做项目吗?」这种泛泛的问题。
- ✅ 可以问具体的问题:数据集的某个特征会不会让它不合适——同时附上你自己的判断和理由。
3.6 开放数据集帖子里的资源(节选)
| 类别 | 资源 |
|---|---|
| 通用 | Google Dataset Search、Kaggle、CompEngine(USyd Ben Fulcher 的时间序列库)、Oliver Cliff 的多变量时间序列库(每个 5–25 个过程、100–2500 个观测)、Data is Plural |
| 机器学习 | UC Irvine ML repository(适合「选特征预测 class」)、torch 自带数据集 |
| 经济/社会 | DJIA 成分股 1939–2010 日收盘价、Python
yfinance、五大股指 2000–2019、Maddison 历史 GDP
数据库、World Bank、DB.NOMICS、US Economic time series |
| 生物医学 | PhysioBank(心脏和部分神经时间序列)、智能手机传感器的人类活动识别数据集(50+) |
| 神经科学 | 开放神经数据集列表、静息态 fMRI(20 个脑区 × 161 名受试者 × 约 150 时间步)、BOLD5000、视觉皮层 10000 个神经元记录、斑马鱼全脑钙成像、癫痫 EEG 数据集 |
| 合成数据 | dysts:生成
100+ 种混沌系统的 Python 库 |
| 音乐 | Music21、kunstderfuge.com 的 .mid 文件(配合 MuseScore 处理) |
四、Stage 1 — Proposal 要求
4.1 格式
| 项目 | 规定 |
|---|---|
| 长度 | 750–1000 词,硬上限:超出部分不会被阅读(Unit Outline 写的是 1000 词) |
| 计入字数 | 正文全部,包括文内引用和对图的引用 |
| 不计入字数 | 参考文献列表、AI 使用声明 |
| 排版 | 1.5 倍行距、12 号字 |
| 文件 | DOC / DOCX / PDF |
| 提交次数 | 不限次数 |
4.2 内容:两大部分
(A) Motivation / Aim / Materials(12 分)
- 数据集:一个适合做信息论分析的数据集,给出下载或生成来源的引用/链接(如适用)。
- 问题 /
假设:信息论能回答的关于这个数据集的问题。页面举例:
- 数据的变异性
- 变量之间的关系
- 高阶关系(条件的或多变量的)
- 这些度量或关系随时间、随条件怎么变
- 动机:为什么这些问题有意思、有意义。
- 相关文献:找出文献里类似的分析,说明你的工作和它们的关系,或者怎么在其基础上扩展。
(B) Method(8 分)
说明如何预处理数据、如何应用信息论度量。页面列出的问题:
- 用哪个度量回答你的问题?
- 分析数据集的哪些部分?
- 用哪个估计器?相关参数怎么设?
- 这个分析和你的假设或实验问题怎么对应?
- 打算怎么解读结果?
页面提醒:presentation 阶段必须提交代码,并且默认用 JIDT 做信息论计算。
4.3 FAQ 里关于 proposal 的细节
| 问题 | 官方答复 |
|---|---|
| 要几个研究问题?每个都要有假设吗? | 没有固定数量——回答一个问题的工作量因题而异,规模要足够撑满最终的 presentation 时间。探索性问题可以,说清楚动机即可;真有预期的地方就写出假设,越具体(字数允许内)proposal 越强 |
| 参考文献格式? | 任何一致的标准格式都行,包含作者、标题、年份等关键信息 |
| 要写公式吗? | 要写出所用度量的数学公式,并配上通俗解释,不要只用文字描述 |
| 能放图吗? | 鼓励。系统示意图或预期效果的示意图往往比文字清楚。但proposal 必须自成一体,正文以外的东西不会被评分 |
五、Stage 1 Rubric(20 分)
Motivation / Aim / Materials(12 分)
| 档次 | 分数 | 标准 |
|---|---|---|
| HD | 12 – >10.19 | 在 D 基础上展现杰出洞见;对系统/数据与假设/问题之间联系有高水平认识;相对已有相关工作的定位非常出色 |
| D | 10.19 – >8.99 | 在 CR 基础上,对数据集相关方面的描述更有深度、更有判断力;出色地论证问题与系统的相关性和联系;清楚描述与其他研究的关系 |
| CR | 8.99 – >7.79 | 在 P 基础上,很好地描述数据集相关方面(包括可能的预处理);列出描述清楚、具体、合适的问题/假设;较好地论证问题与系统的关系;给出引用或链接(如适用) |
| P | 7.79 – >5.99 | 对系统/数据集和问题/假设只有粗浅描述;数据集可能选得不好,问题/假设可能不太有判断力 |
| F | 5.99 – >0 | 数据集和问题/假设的选择或描述不充分,或 proposal 不合适 |
Method(8 分)
| 档次 | 分数 | 标准 |
|---|---|---|
| HD | 8 – >6.79 | 在 D 基础上,展现对任务杰出的专业认知 |
| D | 6.79 – >5.99 | 在 CR 基础上,全面给出最佳实践的分析,并在合适处给出合乎逻辑的后续分析;对信息论工具该怎么用有更深的见解 |
| CR | 5.99 – >5.19 | 充分且具体地描述分析,包括:①数据怎么预处理;②用哪些度量;③有理由的估计器选择;④参数怎么选。所提分析与问题/假设高度匹配 |
| P | 5.19 – >3.99 | 对分析方法和度量只有粗浅概述;可能与问题/假设对不太上,或估计器/参数明显有更好的选择 |
| F | 3.99 – >0 | 分析方法和度量的概述不充分或不完整;和假设/问题不匹配;或分析方案不合适 |
读 rubric 的要点:Method 拿 CR 的四个硬性要素是预处理、度量、估计器选择的理由、参数选择方法,缺一个就很难上 CR。要到 D,需要写出后续分析(比如显著性检验、控制自相关、用条件互信息追问),体现「知道这些工具该怎么用」。
六、Stage 2 — Video Presentation 要求
6.1 形式硬性规定
| 项目 | 规定 |
|---|---|
| 时长 | 10 分钟(硬上限) |
| 格式 | 自定,只要覆盖要求的内容 |
| 声音 | 必须是你本人的声音 |
| 出镜 | 至少 1 分钟出现在镜头里(比如右上角 Zoom 式小窗) |
| Slide 数量 | 最多 7 页;标题页和参考文献页不计入 |
| 现场演示 | slides 之外的演示、「现场」分析等不计入 7 页 |
FAQ 补充:
- 超时:尽量控制在时限内,别默认超一点没事;超几秒一般不会扣分,除非超出或缺失的部分包含关键内容。
- 切换到代码/notebook 演示:可以,还能直接展示分析过程,但不要借 notebook 单元格塞进超出 7 页的内容。
- 参考文献页不计入页数限制,所以要放完整、格式规范的参考文献——只写作者、年份、标题的简短列表不够。
- 不能额外交补充材料来放 slides 装不下的细节。代码注释可以澄清小细节,但不保证评分人会看,不能靠它传递本该在 presentation 里的信息。
- 小技术问题(几秒音画不同步、上传后只显示为下载链接)一般不影响分数,担心的话在提交处留言说明。
6.2 内容:四部分(科学实验报告结构)
- Motivation / Aim / Materials:同 proposal。
- Method:同 proposal。
- Results:执行分析并报告结果。必须用 JIDT。页面鼓励:分析中得到的洞见可能引出新的分析,不要怕回头调整问题、做补充分析。
- Discussion:讨论并批判性评估结果,说明它们怎样回答了最初的问题/假设。必须包括:
- 结果怎么解读,对系统有什么洞见?
- 结果统计上显著吗?
- 其他批判性分析视实验而定,例如:分析如何改进、未来如何扩展、结论能否推广到其他系统等。
FAQ 关键点:presentation 必须自成一体
评分 presentation 的人不一定是评 proposal 的人,不应该需要回去读你的 proposal 才能看懂。所以要重新讲一遍 proposal 里的动机、目标、材料和方法(加上之后的修改)。这些不一定要写在 slides 上,视频里口头讲清楚也可以。
6.3 可以换题吗?
- 可以换数据集和/或问题。
- 代价:proposal 的意义在于拿反馈,换了方向就拿不到新方向的反馈——要权衡,但真需要换就换。
- 不需要重交或重写 proposal,直接把变化体现在 presentation 里。
- FAQ:proposal 分低不代表必须换题(除非反馈明确说数据集不合适),坚持原题本身不会导致 presentation 分低。
6.4 视频上传与提交细节
两种方式:
- 上传到第三方网站,要求上传时间有标记且不可更改(比如 YouTube,可设为 Unlisted);不要用 Dropbox;FAQ 补充:Google Drive 这类外部下载链接也不接受。发帖时可以只贴链接,也可以嵌入视频。
- 直接上传到 Canvas:用回复编辑器上方的 Studio 按钮(FAQ 推荐方式)。以 Canvas 附件形式上传也可以,即使只显示为下载链接。
⚠️ 上传可能要一个多小时,网络中断还得重来——确保截止前传完是你自己的责任。
重交与「占位帖」:
- 截止前可以无惩罚重交:回复你自己的原帖发新视频。帖子无法删除,评分以最新一版为准,提交时间也按最新一版算(晚于截止就按迟交处理)。
- ❌ 严禁发「假提交」(dummy submission):为了提前进入论坛看别人的视频而发一个不是真正尝试的占位帖——扣 30%,即使之后删掉也一样。保留原始文件,可能需要用来证明第一版是真实尝试。
- 讨论区的「Project videos - Group X」论坛目前还没建,老师说 11 月 8 日前一定会建好。
七、Stage 2 Rubric
Rubric 三项满分 10 + 20 + 20 = 50 分,而 assignment 页面显示是 40 pts(40%)——应该是按比例折算,页面上没有写明。
Aim / Motivation / Overall framing(10 分)
| 档次 | 分数 | 标准 |
|---|---|---|
| HD | 10 – >8.49 | 在 D 基础上展现杰出洞见;对系统/数据与假设/问题联系的高水平认识;相对已有工作的定位非常出色 |
| D | 8.49 – >7.49 | 在 CR 基础上,数据集描述更有深度;出色地论证问题与系统的联系;全面地说明与其他研究(同样或其他度量、同一或相关数据集)的关系 |
| CR | 7.49 – >6.49 | 在 P 基础上,很好地描述数据集;问题/假设清楚、具体、合适;较好地论证与系统的联系,包括与其他研究的关系 |
| P | 6.49 – >4.9 | 系统/数据集和问题/假设的描述过得去;问题/假设有,但可能不清楚、不完全合适、流于表面或范围太小;有一些动机 |
| F+ | 4.9 – >3 | 粗浅描述;数据集可能选得不好,问题/假设不太有判断力 |
| F− | 3 – >0 | 选择或描述不充分,或方案不合适 |
Application of information theory — Methods / Results(20 分)
| 档次 | 分数 | 标准 |
|---|---|---|
| HD | 20 – >16.99 | 信息论应用杰出:方法高度合适且清晰,结果/分析杰出;设计与执行良好,能对系统/数据集给出有建设性的洞见;大量工作且完全切题;对所讲内容的理解杰出 |
| D | 16.99 – >14.99 | 内容完全切合目的:对信息论工具该怎么用有更深见解;结果与分析非常完整;工作出色;理解出色 |
| CR | 14.99 – >12.99 | 内容切合目的:方法非常合适且描述清楚;分析完整,能合理地回答问题/假设;工作良好;理解良好 |
| P | 12.99 – >9.99 | 内容大体合适但不够深入:方法和结果合理,但可能描述或选择得不好、范围太小、调查不完整、有明显更好的选择,或理解不足;工作量够。代码已提供、在要求处使用了 JIDT、并与 presentation 一致 |
| F | 9.99 – >0 | 合适内容或对信息的掌握不足;相关工作的证据不足 |
注意 P 档就明确写了代码要求:代码提交了 + 用了 JIDT + 和 presentation 对得上。这三条做不到,这一项连 P 都很难拿。
Discussion and critical analysis(20 分)
| 档次 | 分数 | 标准 |
|---|---|---|
| HD | 20 – >16.99 | 在 D 基础上,洞见达到该领域研究项目的水平;能表现出对所做工作成熟的理解 |
| D | 16.99 – >14.99 | 对结果如何解读系统/数据集的讨论更有力、更系统、概念上更深入;对分析相关问题的批判性评估很强 |
| CR | 14.99 – >12.99 | 较好地讨论分析对系统/数据集意味着什么;对分析的若干问题有较好的批判性评估,其中一些有深度 |
| P | 12.99 – >9.99 | 对信息论调查结果的讨论/解读粗浅,批判性分析有限 |
| F | 9.99 – >0 | 解读或评估不充分、不完整或不合适;可能聚焦于无关方面 |
分值分布说明重心:Methods/Results 和 Discussion 各占 40%,Framing 只占 20%。解读和批判性评估和分析本身同样重要。
八、Code Submission
截止:与 presentation 相同(11 月 8 日 23:59)。
不单独计分,但提交有两个目的:
- 大学政策:所有项目代码都必须提交并过 Turnitin。老师知道 AutoAnalyser 生成的代码部分会有大量重合,这没问题。
- 给评分人交叉核对:必要时核对 presentation 里的解释,验证分析代码与 presentation 描述一致——这可能影响 presentation 的分数。
格式要求:
| 要求 | 说明 |
|---|---|
| 单个 PDF | 目前唯一接受的格式;多个文件合并成一个 PDF,不要交文件夹 |
| 可读、可搜索 | 不要交截图拼成的 PDF |
| 包含所有代码 | 包括数据预处理步骤,不只是核心分析 |
| 输出和图 | notebook 导出的 PDF 带不带输出和图都可以 |
| 导出的中间文件 | 比如导出给画图用的 CSV 不用交,交生成它的代码即可 |
| 运行环境 | 本地 Jupyter 还是 Google Colab 都无所谓 |
| 不需要整理 | 代码不评分,不用花时间美化 |
| 不要交数据集 | 只交代码 |
导出小技巧(FAQ):notebook 直接导出 PDF 格式乱或内容被截断时,先导出成 HTML 再转 PDF。
九、JIDT、估计器与显著性检验(FAQ)
9.1 必须用 JIDT 吗?
必须。这是硬性要求,不是建议。
- 页面原文:信息论计算必须用 JIDT,除非有特殊原因(比如需要 JIDT 没有的功能)。
- JIDT 跑不起来(比如某个 estimator 类加载失败)时,先按安装指南和前面课上的代码例子排查,不要换成别的库里同样的估计器实现。
- 在这个前提下使用方式灵活:
- 用 JIDT GUI(AutoAnalyser)——要把它生成的代码保存下来一起交,让具体设置一目了然
- 从自己的代码里调用 JIDT——推荐,更容易展示完整过程
- 需要多变量网络推断时可以用 IDTxl(它建立在 JIDT 的估计器之上)
9.2 用哪个估计器?必须是课上讲过的吗?
- 不限于课上讲过的估计器,离散和连续估计器都同样可以。
- 无论选哪个,都要说明为什么适合你的数据和所算的度量,并吸收 proposal 的反馈。
- 优先用 JIDT 已实现的;用 JIDT 之外的估计器需要充分理由。
9.3 同样的分析每次运行结果略有不同,是出错了吗?
不是,这是正常的:
- KSG 估计器会给数据加一点噪声来保持数值稳定;
- 任何通过重抽样做经验显著性检验的方法,结果也都有随机性。
处理办法:
- 点估计本身的波动很小,不需要多跑几次取平均。
- 想要可复现的数字放进 presentation:可以把 JIDT 的加噪水平设为 0 并固定随机种子,但不强制。
- presentation 里的数字和代码重跑结果略有出入不是问题,除非差得很离谱。
9.4 用多少个 surrogate?太慢怎么办?
- 课上演示用的数量(常接近 1000)不是硬性要求。有真实理由(比如计算太久)时可以少用,但要说明理由。
- surrogate 少时提高 p 值可靠性的办法:用手头的 surrogate 值拟合一个高斯分布,把实测统计量和拟合出的分布比较,而不是和很小的经验样本比。
- 数据集很大、或要做很多两两计算导致 JIDT 整体很慢时:
- 可以只在有代表性的一部分比较上做完整显著性检验,并合理假设类似情况的零分布相同;
- 或者研究 JIDT 的实验性 GPU 支持(用于 KSG 类度量;非官方,本课不直接支持)。
9.5 试了很多参数,只有少数几个结果显著,用那几个?
- 选方法论上最站得住脚的参数组合,不是选恰好出了你想要结果的那组。如实说明参数是怎么定下来的。
- 结果是否为阳性不影响分数,只要假设动机充分、方法合适。
- 如果「选对参数」本身就是研究问题的一部分,可以像 tutorial 里那样生成零假设下的 surrogate 分布,帮助判断某个参数下看起来显著的结果是不是巧合。
这其实就是在防 p-hacking:多次尝试后挑显著的结果报告,本质上是多重比较问题。
十、评分导向:什么不会加分,什么不会扣分
| 误区 | 官方答复 |
|---|---|
| 用更多、更高级的度量(比如 transfer entropy)分数更高? | 不会。重要的不是用了多少种、多高级的度量,而是多全面地回答一个选得好的问题。度量少但解读和追问深入的项目,通常比度量多但浅尝辄止的项目分高 |
| 结果乱、不确定、甚至和假设相反,会扣分吗? | 不会,只要分析设计合理、问题合理、数据集选得合理。拒绝一个假设(哪怕它来自已有文献)完全是正当的结果,关键是方法可靠、如实解读和讨论。时间还得填满,所以可以用来分析为什么没看到预期效果、追问一个相关问题或深挖数据;换数据集是最后手段 |
| Proposal 分低,presentation 分上限就低? | 不直接影响。除非反馈明确说数据集不合适,否则不必换题 |
十一、老师课上关于「好问题」的建议(Week 7)
关于关系的问题远比关于熵的问题有意思。
可以问的方向:
- 哪些变量之间关系最强——关系的「热点」在哪
- 关系随时间怎么变——不同时间窗口的变化是否符合系统当时的状态
- 不同条件下关系怎么变——比如对照组 vs 执行任务时
- 高阶关系——比如多个来源提供的信息是相同还是不同,用条件互信息区分冗余与独有/协同信息
- 逐样本的 pointwise 值——看关系如何动态变化
- 网络关系建模——Module 12 的内容,可以提前看
课上也有一个以前优秀项目的示例 presentation 可以参考(链接在 Proposal 页面上)。
十二、与课程内容的对应
| 作业需要的能力 | 对应周次 |
|---|---|
| 熵、互信息、条件互信息的定义与解读;写出所用度量的公式 | Week 1–4 |
| JIDT 安装、AutoAnalyser、扩展生成的代码 | Week 5 |
| 估计器选择(离散 / Gaussian / Kernel / KSG)、参数选择、bias 与 variance、Gaussian + KSG 四象限解读 | Week 6 |
统计显著性(surrogate、p
值)、样本量启发式、自相关与
DYN_CORR_EXCL、平稳性与差分预处理 |
Week 7 |
| 文献中怎么用信息论做数据分析(问题、数据、预处理、度量、估计器与参数、评价)、对真实系统提好问题 | Week 8 |
| Transfer entropy、信息存储、网络推断(可选,不要求) | Week 9–12 |
Module 8 Item 2 文献阅读的 5 个要点,基本就是 proposal 的骨架:问题 → 用信息论回答的主要问题 → 数据与预处理 → 度量、估计器与参数 → 评价(优缺点、结论是否成立、扩展)。