补考

2026 补考

你需要完成 4 个项目,所有数据集均为公开可用。对每个项目:

  1. 从下方 Kaggle 链接下载数据集。

  2. 进行快速 EDA:变量类型、分布、缺失值、初步可视化。最后用文字总结问题的性质和合适的评估指标。

  3. 根据 EDA 自行决定采用何种建模方法。

  4. 实现你的解决方案,做严谨的评估(交叉验证、保留测试集等),并对你的方法学选择进行说明。

 

提交格式: 一个 Jupyter notebook(.ipynb 文件),包含全部 4 个项目,各项目分章节清晰标识。Notebook 必须能从头到尾顺利运行。

 


 

1. 美国二手车广告

你拿到一份美国二手车广告网站的数据导出(约 40 万条广告,约 25 列)。每条广告含有制造商、车型、年份、里程、卖家描述的车况、燃料类型、变速箱、车身颜色、所在州以及标价。

广告由用户手动填写:存在大量缺失值、异常价格(0 美元、9 999 999 美元……)、超高基数的类别变量、可能的重复条目。

你需要自行决定要预测什么,以及如何在建模前正确地编码类别列。

🔗 Kaggle 数据集 — Used Cars Dataset (Craigslist)

 


 

2. 太空泰坦尼克号 — 失踪的乘客

太空船 Spaceship Titanic 载着约 8 700 名乘客飞往三颗适居系外行星,途中遭遇时空异常。

数据集提供乘客的出行记录:舱位、出发星球、年龄、船上各设施的消费,以及目标变量

Transported
。多列含有缺失值,而乘客的完整姓名暗示了家庭成员的分组,你可以加以利用。

🔗 Kaggle 数据集 — Spaceship Titanic

 


 

3. Kuzushiji-MNIST — 江户古文字

KMNIST 是一份 7 万张灰度图像(28×28)的数据集,内容是日本江户时期古籍中的草书假名(kuzushiji)。

与 MNIST 一样有 10 个类别(十个假名字符),但视觉难度更高:同一类的写法差异很大,且部分字符相互非常相似。

你可以沿用在经典 MNIST 上的工作流程,并视需要做调整。

🔗 Kaggle 数据集 — Kuzushiji-MNIST

 


 

4. 异形大战铁血战士 — 谁是谁?

一个电影剧照数据库混合了科幻系列《异形》和《铁血战士》的图像。数据集仅包含几百张彩色图像,分别放在

alien
predator
两个文件夹中,且已经做好了训练/验证集划分。

挑战在于:在极少量数据下训练一个高性能的图像分类器。

🔗 Kaggle 数据集 — Alien vs Predator Images

 


 

通用建议

  • EDA 决定一切:先充分理解数据,再写模型代码。
  • 记录你的假设、预处理选择和评估指标。
  • 一个评估严谨的简单基线胜过一个仓促搭建的复杂模型。
  • 你可以在 Kaggle Notebooks 中享用现成的环境和 GPU,完成后把最终的
    .ipynb
    上传到这里。