补考2026 补考
你需要完成 **4 个项目**,所有数据集均为公开可用。对每个项目:
1. 从下方 Kaggle 链接下载数据集。
2. 进行**快速 EDA**:变量类型、分布、缺失值、初步可视化。最后用文字总结问题的性质和合适的评估指标。
3. 根据 EDA 自行决定采用何种建模方法。
4. 实现你的解决方案,做严谨的评估(交叉验证、保留测试集等),并对你的方法学选择进行说明。
**提交格式:** 一个 **Jupyter notebook(.ipynb 文件)**,包含全部 4 个项目,各项目分章节清晰标识。Notebook 必须能从头到尾顺利运行。
---
### 1. 美国二手车广告
你拿到一份美国二手车广告网站的数据导出(约 40 万条广告,约 25 列)。每条广告含有制造商、车型、年份、里程、卖家描述的车况、燃料类型、变速箱、车身颜色、所在州以及标价。
广告由用户手动填写:存在大量缺失值、异常价格(0 美元、9 999 999 美元……)、超高基数的类别变量、可能的重复条目。
你需要自行决定要预测什么,以及如何在建模前正确地编码类别列。
🔗 [Kaggle 数据集 — Used Cars Dataset (Craigslist)](https://www.kaggle.com/datasets/austinreese/craigslist-carstrucks-data)
---
### 2. 太空泰坦尼克号 — 失踪的乘客
太空船 *Spaceship Titanic* 载着约 8 700 名乘客飞往三颗适居系外行星,途中遭遇时空异常。
数据集提供乘客的出行记录:舱位、出发星球、年龄、船上各设施的消费,以及目标变量 `Transported`。多列含有缺失值,而乘客的完整姓名暗示了家庭成员的分组,你可以加以利用。
🔗 [Kaggle 数据集 — Spaceship Titanic](https://www.kaggle.com/competitions/spaceship-titanic/data)
---
### 3. Kuzushiji-MNIST — 江户古文字
KMNIST 是一份 7 万张灰度图像(28×28)的数据集,内容是日本江户时期古籍中的草书假名(*kuzushiji*)。
与 MNIST 一样有 10 个类别(十个假名字符),但视觉难度更高:同一类的写法差异很大,且部分字符相互非常相似。
你可以沿用在经典 MNIST 上的工作流程,并视需要做调整。
🔗 [Kaggle 数据集 — Kuzushiji-MNIST](https://www.kaggle.com/datasets/anokas/kuzushiji)
---
### 4. 异形大战铁血战士 — 谁是谁?
一个电影剧照数据库混合了科幻系列《异形》和《铁血战士》的图像。数据集仅包含几百张彩色图像,分别放在 `alien` 和 `predator` 两个文件夹中,且已经做好了训练/验证集划分。
挑战在于:在极少量数据下训练一个高性能的图像分类器。
🔗 [Kaggle 数据集 — Alien vs Predator Images](https://www.kaggle.com/datasets/pmigdal/alien-vs-predator-images)
---
**通用建议**
- EDA 决定一切:先充分理解数据,再写模型代码。
- 记录你的假设、预处理选择和评估指标。
- 一个评估严谨的简单基线胜过一个仓促搭建的复杂模型。
- 你可以在 Kaggle Notebooks 中享用现成的环境和 GPU,完成后把最终的 `.ipynb` 上传到这里。
最大 50 MB · 类型 : .ipynb