For the complete documentation index, see llms.txt. This page is also available as Markdown.

数据分析及实践(专业核心)

学分:3.0

Presented by Wanglulu:wanglulu114514@mail.ustc.edu.cn

课程教材

课程简介

数据分析及实践是数据科学专业的专业核心课程,主要内容为数据从生成到处理,再到利用的各个环节以及所涉及到的算法等,内容主要包括数据采集、数据预处理、特征工程、数据统计、数据挖掘。其中数据统计包含各种统计量、参数估计方法、假设检验方法、抽样方法等;数据挖掘包含分类与预测、聚类、关联分析和异常检测等。课程知识量较大,并伴有多次实验。

前置知识涉及的课程

概率论与数理统计、机器学习

这门课的四个章节分别叫数据科学基础、数据入门、数据统计和数据挖掘,但是等上完这门课以后会发现这四个章节都有更好的名字:

  1. 数据科学科普

  2. 数据采集和处理

  3. 概统

  4. 机器学习

如果你在上这门课前已经上了人工智能与机器学习基础,你会在这门课里见到很多熟悉的面孔,尤其是第二章和第四章。

课堂概况

刘淇老师执教这门课多年,已经形成了自己独特的上课风格,而2026年春季程明月老师的加入无疑为课堂注入了新鲜血液,让本课程呈现出一种勃勃生机万物竞发的境界。蒸蒸日上!

本课程的排课一般为下午的8、9、10节,但是基本不会提前下课。

课堂讲解完全基于PPT,附带少量板书。这门课的内容100%包含在PPT内,备考完全可以仅依赖PPT。但是本课程的PPT从开课以来直至2026年春似乎都没有更新过,其中存在的情况包括但不限于:

  • 字被图片挡住

  • 中英混杂

  • 部分内容过时

  • 重点不突出

课程讲授的的大多数知识点都是非常有用的,属于数据科学的学科常识和基础算法。不过课程的编排方式可能使内容显得难以理解。如有需要可以进行基于大模型的学习。

课上有小测而且可能上到一半就测。

实验概况

本课程没有祖传实验,每年都会设计新的实验。2026年春季的实验有5个,内容如下:

  1. Python 基础,在bdaa的平台上写Python题

  2. 从ICLR2026的网页上爬取数据并清洗

  3. 使用给定的ICLR论文信息数据集进行统计分析

  4. 使用给定的ICLR论文信息数据集进行关联规则挖掘

  5. 使用给定的ICLR论文信息数据集进行机器学习,预测论文能否被Accept,并尝试编写能够自动执行数据分析脚本的Agent

需要注意目前的大模型已经能够独立完成所有实验,但实验中仍然有不少细节问题是只靠大模型无法解决的,比如爬虫的访问参数、数据过脏、数据图表分析等。这里特别提一下数据过脏,课上专门强调了数据分析的80%时间都在清洗数据,可能还不止。实验涉及到的数据集大概率会存在大量的格式错误、数值缺失等问题,需要仔细处理。

除实验1以外所有实验都需要写报告,报告要求按照实验步骤写明每一步的结果和分析。同学们不要提交纯血的AI报告,可能会导致一个比较低的分数。另外,2026春的报告要求直接提交md文件,请注意如果md文件中附有图片的话需要连带图片一起打包提交。

如果实验做得好可能会被选中上台分享。

考试情况

没有往年题,评课社区所有的往年题都是学长靠超强记忆力弄出来的。备考除了PPT就是评课社区。可以让AI帮你看着考点出点模拟题。

2026春季的考试题型为10道定项选择,4道不定项选择,3道填空,4道简答和4道综合,整体题量较大,考察内容广泛但不超出PPT。

每个章节的考察重点如下,其中带*的为非常重要的重点:

第一章

没有。

第二章

  • 爬虫:载入、解析和存储过程,数据请求方式,反爬虫和去重

  • 数据存储:结构化、半结构化、非结构化

  • *数据预处理:数据清理、集成、变换、规约(这个部分是重中之重,会有大量可以计算的指标)

  • *特征工程:特征构造、TF-IDF、特征子集评价

第三章

  • 反映数据集中趋势的分布指标:各种平均值、分位数、众数、箱图(各种统计图表)

  • 反映数据离散趋势的分布指标:方差/标准差、极差/四分位差、异众比、变异系数

  • 反映数据分布形态的分布指标:偏度系数、峰度系数

  • *参数估计:矩估计、最小二乘估计、MLE、MAP、Bayes估计、无偏有效相合

  • 假设检验:第一类/第二类错误

  • 抽样:各种抽样方法

第四章

  • 关联规则:项集、*支持度、*置信度、*Apriori算法、FP-Growth算法、提升度、辛普森悖论

  • 分类:*Acc/Pre/Recall/F1、ROC曲线、*决策树(信息增益、基尼指数、过拟合分析、剪枝)、Bayes分类器、感知机、KNN

  • 数据集成:Bagging、Boosting、评价指标

  • 时序预测:各种概念和性质、*ARIMA算法

  • 聚类:层次聚类、密度聚类(DBSCAN)、SSE/SSB

评分细则

实验30分,考试60分,平时10分。这门课刚开始是没有考试的,2024年开始考试占大头,上这门课的同学一定要好好准备考试。

其他

本课程被广大同学评价为上课、实验、考试正交,请做好大量自学的准备。

课堂上涉及数据库的内容都可以不听,因为数据库系统概论会讲。

出分非常慢,不建议急需学分的同学选修/重修。

这是我给这门课写的评课,里面有一份叫做《AIDS课堂实践学导论》的文件,大家可以看看:https://icourse.club/course/24511/#review-102091

老学长留下的链接

最后更新于