机器学习基础(监督/无监督/评估)

共 20 题
#

1. 监督学习、无监督学习、半监督学习与强化学习的区别是什么,各自典型任务(分类/回归/聚类/决策)是什么?

A 半监督学习同时利用有标签与无标签数据,可在标注成本高时提升性能 ✓ 正确答案
B 回归属于无监督学习,因为输出是连续值而非离散标签
C 强化学习的目标是拟合历史标签,而非通过交互优化累积回报
D 聚类属于监督学习,因为需要预先指定类别数
#

2. 过拟合与欠拟合的成因与表现是什么,训练集/验证集/测试集为什么必须严格分离?

A 过拟合时训练误差与验证误差都很高
B 欠拟合意味着模型容量过大,需要增加复杂度
C 验证集可以反复用于调参,因为它只影响模型选择不影响最终评估
D 测试集一旦被用于调参或特征选择,评估结果就会失真 ✓ 正确答案
#

3. L1 与 L2 正则化、Dropout、早停分别如何缓解过拟合,为什么 L1 会产生稀疏解而 L2 不会?

A L1 正则化往往把部分权重置为 0,可用于特征选择 ✓ 正确答案
B L2 正则化在零点不可导,因此更容易产生稀疏解
C L1 正则化倾向于把所有权重均匀压小,但不会出现零
D Dropout 在测试时仍随机丢弃神经元以保证一致
#

4. 偏差-方差分解的含义是什么,模型复杂度与泛化误差的关系曲线为什么呈 U 形?

A 存在一个最优复杂度使偏差与方差的权衡达到平衡,泛化误差最小 ✓ 正确答案
B 泛化误差、偏差与方差呈单调关系,复杂度越高误差越低
C 欠拟合时误差主要来自方差,过拟合时主要来自偏差
D 模型越复杂,偏差越大、方差越小
#

5. 准确率、精确率、召回率、F1 与 AUC-ROC 分别适合什么场景,类别不平衡时为什么不能只看准确率?

A 类别严重不平衡时,准确率仍是最可靠的评估指标
B 癌症筛查这类"漏报代价高"的场景应优先关注召回率 ✓ 正确答案
C 精确率衡量的是真正例中被正确预测的比例
D AUC 依赖具体阈值,不易在类别不平衡时使用
#

6. K 折交叉验证与留一法为什么比单次划分更可靠,如何用交叉验证选择超参数并防止数据泄漏?

A 交叉验证通过多次轮流划分并取平均,评估比单次划分更稳定 ✓ 正确答案
B 在划分前对整个数据集做标准化,不会造成数据泄漏
C 留一法计算量小,适合大规模数据
D 数据泄漏会高估验证误差,使模型选择偏向简单模型
#

7. 线性回归的 MSE 损失与逻辑回归的交叉熵损失各有什么特点,为什么分类不用 MSE?

A 分类任务使用 MSE 能避免梯度饱和,收敛更快
B MSE 在 Sigmoid 输出下是凸函数,不易陷入局部最优
C 交叉熵损失直接度量预测概率与真实标签分布的差异,适合分类 ✓ 正确答案
D 线性回归使用交叉熵损失实现极大似然估计
#

8. 批量梯度下降、随机梯度下降与小批量梯度下降的差异,学习率过大/过小分别导致什么问题?

A 学习率过大可能导致参数震荡甚至发散不收敛 ✓ 正确答案
B 小批量梯度下降的批量通常取全部训练样本
C 学习率过小收敛快,是首选设置
D 批量梯度下降噪声大、收敛震荡,适合大型数据集
#

9. 标准化/归一化、缺失值处理与类别特征编码对模型训练有什么影响,树模型与线性模型有何不同?

A 线性模型依赖距离与梯度计算,标准化能加速收敛 ✓ 正确答案
B 树模型对特征尺度非常敏感,必须先标准化
C 类别特征用 one-hot 编码会人为引入顺序关系
D 归一化与标准化对模型训练结果没有任何影响
#

10. K-Means、层次聚类与 DBSCAN 的适用场景,K 值如何用肘部法/轮廓系数选择?

A K-Means 适合任意形状的簇且能自动识别噪声点
B 轮廓系数越大表示聚类越差,应选择系数最小的 K
C 层次聚类计算量小,适合海量数据
D DBSCAN 基于密度,无需指定 K,能处理不规则形状与噪声 ✓ 正确答案
#

11. 决策树的分裂准则(信息增益/基尼系数)是什么,随机森林如何通过样本与特征随机降低方差?

A 基尼系数越大表示节点越纯,越适合分裂
B 随机森林在每棵树的所有特征中选择最优分裂特征
C 信息增益基于熵的减少来衡量分裂带来的纯度提升 ✓ 正确答案
D 随机森林通过降低偏差来提升泛化能力,方差反而增大
#

12. 类别不平衡的常用处理,重采样、代价敏感学习与 Focal Loss 的取舍是什么?

A Focal Loss 通过调制因子降低易分类样本的权重,使模型专注难样本 ✓ 正确答案
B SMOTE 属于欠采样,直接丢弃多数类样本
C 代价敏感学习会改变数据分布,因此常用于数据增强
D 过采样会丢失多数类信息,导致明显欠拟合
#

13. Bagging 与 Boosting 的核心差异,随机森林(Bagging)如何降低方差、GBDT/XGBoost(Boosting)如何降低偏差,各自对噪声与异常值的敏感性如何?

A Bagging 通过残差迭代降低偏差,Boosting 通过平均降低方差
B GBDT 通过方差降低提升精度,对噪声不敏感
C Boosting 的各基学习器并行训练,互不影响
D 随机森林对噪声与异常值更稳健,因为随机子集与平均稀释了异常影响 ✓ 正确答案
#

14. 数据泄漏的常见来源,目标泄漏、时间泄漏与重复样本在特征与验证集构建中如何产生,如何用时间切分防止?

A 当特征包含未来信息、或同一实体横跨训练集与测试集时,就会造成数据泄漏 ✓ 正确答案
B 目标泄漏指特征与目标在时间上重叠,但不会影响评估
C 时间序列数据应随机切分,以充分利用数据
D 重复样本造成泄漏的原因是特征缺失偏多
#

15. 特征工程基础,数值分箱、交互特征与目标编码各自的风险,特征重要性评估在树模型与线性模型的差异如何?

A 数值分箱越多越好,能完全避免过拟合
B 线性模型中系数绝对值可直接跨尺度比较,无需标准化
C 目标编码直接使用目标统计量,若不做防泄漏处理极易造成过拟合 ✓ 正确答案
D 树模型的特征重要性基于线性系数,无法反映非线性关系
#

16. 学习曲线与验证曲线,如何用它们诊断高偏差/高方差并决定"加数据还是加特征",与正则化调参的关系如何?

A 高偏差时训练误差低、验证误差高,加数据能显著改善
B 高方差时训练误差与验证误差都很高且接近,应增加特征
C 学习曲线横轴是正则化强度,用于观察误差随样本的变化
D 高偏差应增加模型复杂度或特征,加数据对改善几乎没有帮助 ✓ 正确答案
#

17. 朴素贝叶斯与 SVM 的核心假设与适用边界是什么,什么时候它们比深度模型更合适?

A 朴素贝叶斯基于核技巧拟合高维空间
B SVM 需要海量数据才能训练,否则必定欠拟合
C 数据量很小时深度模型通常比 SVM 泛化更好
D 朴素贝叶斯假设特征之间条件独立,适合高维稀疏文本分类 ✓ 正确答案
#

18. 网格搜索、随机搜索与贝叶斯优化的差异,超参数调优与模型选择如何组织?

A 网格搜索在高维空间效率最高,是默认首选
B 贝叶斯优化利用历史评估结果构建代理模型,适合昂贵的评估 ✓ 正确答案
C 随机搜索通过代理模型指导采样,评估次数最少
D 超参数选择可直接在测试集上反复进行,结果更准确
#

19. 机器学习项目全流程(数据清洗、建模、评估、上线、监控)的工程要点是什么,数据与特征质量为何最关键?

A 特征工程在模型上线后无需监控,因为特征不会漂移
B 数据质量决定模型学习到的规律上限,比模型复杂度更关键 ✓ 正确答案
C 数据清洗只影响训练速度,不影响最终模型效果
D 模型上线后无需再监控,因为训练时已评估过
#

20. 模型上线后的监控,数据漂移(drift)与概念漂移的检测方法(PSI、KS),监控指标与重训触发机制如何设计?

A 概念漂移指输入特征分布变化,数据漂移指输入输出映射变化
B PSI 用于比较特征在训练与当前分布上的差异,超阈值提示数据漂移 ✓ 正确答案
C PSI 值越大表示分布越稳定,应降低重训频率
D KS 检验用于衡量模型预测准确率,与分布漂移无关