2026 补考
你需要完成 4 个项目,所有数据集均为公开可用。对每个项目:
-
从下方 Kaggle 链接下载数据集。
-
进行快速 EDA:变量类型、分布、缺失值、初步可视化。最后用文字总结问题的性质和合适的评估指标。
-
根据 EDA 自行决定采用何种建模方法。
-
实现你的解决方案,做严谨的评估(交叉验证、保留测试集等),并对你的方法学选择进行说明。
提交格式: 一个 Jupyter notebook(.ipynb 文件),包含全部 4 个项目,各项目分章节清晰标识。Notebook 必须能从头到尾顺利运行。
1. 美国二手车广告
你拿到一份美国二手车广告网站的数据导出(约 40 万条广告,约 25 列)。每条广告含有制造商、车型、年份、里程、卖家描述的车况、燃料类型、变速箱、车身颜色、所在州以及标价。
广告由用户手动填写:存在大量缺失值、异常价格(0 美元、9 999 999 美元……)、超高基数的类别变量、可能的重复条目。
你需要自行决定要预测什么,以及如何在建模前正确地编码类别列。
🔗 Kaggle 数据集 — Used Cars Dataset (Craigslist)
2. 太空泰坦尼克号 — 失踪的乘客
太空船 Spaceship Titanic 载着约 8 700 名乘客飞往三颗适居系外行星,途中遭遇时空异常。
数据集提供乘客的出行记录:舱位、出发星球、年龄、船上各设施的消费,以及目标变量
Transported。多列含有缺失值,而乘客的完整姓名暗示了家庭成员的分组,你可以加以利用。
🔗 Kaggle 数据集 — Spaceship Titanic
3. Kuzushiji-MNIST — 江户古文字
KMNIST 是一份 7 万张灰度图像(28×28)的数据集,内容是日本江户时期古籍中的草书假名(kuzushiji)。
与 MNIST 一样有 10 个类别(十个假名字符),但视觉难度更高:同一类的写法差异很大,且部分字符相互非常相似。
你可以沿用在经典 MNIST 上的工作流程,并视需要做调整。
🔗 Kaggle 数据集 — Kuzushiji-MNIST
4. 异形大战铁血战士 — 谁是谁?
一个电影剧照数据库混合了科幻系列《异形》和《铁血战士》的图像。数据集仅包含几百张彩色图像,分别放在
alien 和 predator 两个文件夹中,且已经做好了训练/验证集划分。
挑战在于:在极少量数据下训练一个高性能的图像分类器。
🔗 Kaggle 数据集 — Alien vs Predator Images
通用建议
- EDA 决定一切:先充分理解数据,再写模型代码。
- 记录你的假设、预处理选择和评估指标。
- 一个评估严谨的简单基线胜过一个仓促搭建的复杂模型。
- 你可以在 Kaggle Notebooks 中享用现成的环境和 GPU,完成后把最终的
上传到这里。.ipynb