# 1. 监督学习、无监督学习、半监督学习与强化学习的区别是什么,各自典型任务(分类/回归/聚类/决策)是什么? A 半监督学习同时利用有标签与无标签数据,可在标注成本高时提升性能 ✓ 正确答案 B 回归属于无监督学习,因为输出是连续值而非离散标签 C 强化学习的目标是拟合历史标签,而非通过交互优化累积回报 D 聚类属于监督学习,因为需要预先指定类别数
# 2. 过拟合与欠拟合的成因与表现是什么,训练集/验证集/测试集为什么必须严格分离? A 过拟合时训练误差与验证误差都很高 B 欠拟合意味着模型容量过大,需要增加复杂度 C 验证集可以反复用于调参,因为它只影响模型选择不影响最终评估 D 测试集一旦被用于调参或特征选择,评估结果就会失真 ✓ 正确答案
# 3. L1 与 L2 正则化、Dropout、早停分别如何缓解过拟合,为什么 L1 会产生稀疏解而 L2 不会? A L1 正则化往往把部分权重置为 0,可用于特征选择 ✓ 正确答案 B L2 正则化在零点不可导,因此更容易产生稀疏解 C L1 正则化倾向于把所有权重均匀压小,但不会出现零 D Dropout 在测试时仍随机丢弃神经元以保证一致
# 4. 偏差-方差分解的含义是什么,模型复杂度与泛化误差的关系曲线为什么呈 U 形? A 存在一个最优复杂度使偏差与方差的权衡达到平衡,泛化误差最小 ✓ 正确答案 B 泛化误差、偏差与方差呈单调关系,复杂度越高误差越低 C 欠拟合时误差主要来自方差,过拟合时主要来自偏差 D 模型越复杂,偏差越大、方差越小
# 5. 准确率、精确率、召回率、F1 与 AUC-ROC 分别适合什么场景,类别不平衡时为什么不能只看准确率? A 类别严重不平衡时,准确率仍是最可靠的评估指标 B 癌症筛查这类"漏报代价高"的场景应优先关注召回率 ✓ 正确答案 C 精确率衡量的是真正例中被正确预测的比例 D AUC 依赖具体阈值,不易在类别不平衡时使用
# 6. K 折交叉验证与留一法为什么比单次划分更可靠,如何用交叉验证选择超参数并防止数据泄漏? A 交叉验证通过多次轮流划分并取平均,评估比单次划分更稳定 ✓ 正确答案 B 在划分前对整个数据集做标准化,不会造成数据泄漏 C 留一法计算量小,适合大规模数据 D 数据泄漏会高估验证误差,使模型选择偏向简单模型
# 7. 线性回归的 MSE 损失与逻辑回归的交叉熵损失各有什么特点,为什么分类不用 MSE? A 分类任务使用 MSE 能避免梯度饱和,收敛更快 B MSE 在 Sigmoid 输出下是凸函数,不易陷入局部最优 C 交叉熵损失直接度量预测概率与真实标签分布的差异,适合分类 ✓ 正确答案 D 线性回归使用交叉熵损失实现极大似然估计
# 8. 批量梯度下降、随机梯度下降与小批量梯度下降的差异,学习率过大/过小分别导致什么问题? A 学习率过大可能导致参数震荡甚至发散不收敛 ✓ 正确答案 B 小批量梯度下降的批量通常取全部训练样本 C 学习率过小收敛快,是首选设置 D 批量梯度下降噪声大、收敛震荡,适合大型数据集
# 9. 标准化/归一化、缺失值处理与类别特征编码对模型训练有什么影响,树模型与线性模型有何不同? A 线性模型依赖距离与梯度计算,标准化能加速收敛 ✓ 正确答案 B 树模型对特征尺度非常敏感,必须先标准化 C 类别特征用 one-hot 编码会人为引入顺序关系 D 归一化与标准化对模型训练结果没有任何影响
# 10. K-Means、层次聚类与 DBSCAN 的适用场景,K 值如何用肘部法/轮廓系数选择? A K-Means 适合任意形状的簇且能自动识别噪声点 B 轮廓系数越大表示聚类越差,应选择系数最小的 K C 层次聚类计算量小,适合海量数据 D DBSCAN 基于密度,无需指定 K,能处理不规则形状与噪声 ✓ 正确答案
# 11. 决策树的分裂准则(信息增益/基尼系数)是什么,随机森林如何通过样本与特征随机降低方差? A 基尼系数越大表示节点越纯,越适合分裂 B 随机森林在每棵树的所有特征中选择最优分裂特征 C 信息增益基于熵的减少来衡量分裂带来的纯度提升 ✓ 正确答案 D 随机森林通过降低偏差来提升泛化能力,方差反而增大
# 12. 类别不平衡的常用处理,重采样、代价敏感学习与 Focal Loss 的取舍是什么? A Focal Loss 通过调制因子降低易分类样本的权重,使模型专注难样本 ✓ 正确答案 B SMOTE 属于欠采样,直接丢弃多数类样本 C 代价敏感学习会改变数据分布,因此常用于数据增强 D 过采样会丢失多数类信息,导致明显欠拟合
# 13. Bagging 与 Boosting 的核心差异,随机森林(Bagging)如何降低方差、GBDT/XGBoost(Boosting)如何降低偏差,各自对噪声与异常值的敏感性如何? A Bagging 通过残差迭代降低偏差,Boosting 通过平均降低方差 B GBDT 通过方差降低提升精度,对噪声不敏感 C Boosting 的各基学习器并行训练,互不影响 D 随机森林对噪声与异常值更稳健,因为随机子集与平均稀释了异常影响 ✓ 正确答案
# 14. 数据泄漏的常见来源,目标泄漏、时间泄漏与重复样本在特征与验证集构建中如何产生,如何用时间切分防止? A 当特征包含未来信息、或同一实体横跨训练集与测试集时,就会造成数据泄漏 ✓ 正确答案 B 目标泄漏指特征与目标在时间上重叠,但不会影响评估 C 时间序列数据应随机切分,以充分利用数据 D 重复样本造成泄漏的原因是特征缺失偏多
# 15. 特征工程基础,数值分箱、交互特征与目标编码各自的风险,特征重要性评估在树模型与线性模型的差异如何? A 数值分箱越多越好,能完全避免过拟合 B 线性模型中系数绝对值可直接跨尺度比较,无需标准化 C 目标编码直接使用目标统计量,若不做防泄漏处理极易造成过拟合 ✓ 正确答案 D 树模型的特征重要性基于线性系数,无法反映非线性关系
# 16. 学习曲线与验证曲线,如何用它们诊断高偏差/高方差并决定"加数据还是加特征",与正则化调参的关系如何? A 高偏差时训练误差低、验证误差高,加数据能显著改善 B 高方差时训练误差与验证误差都很高且接近,应增加特征 C 学习曲线横轴是正则化强度,用于观察误差随样本的变化 D 高偏差应增加模型复杂度或特征,加数据对改善几乎没有帮助 ✓ 正确答案
# 17. 朴素贝叶斯与 SVM 的核心假设与适用边界是什么,什么时候它们比深度模型更合适? A 朴素贝叶斯基于核技巧拟合高维空间 B SVM 需要海量数据才能训练,否则必定欠拟合 C 数据量很小时深度模型通常比 SVM 泛化更好 D 朴素贝叶斯假设特征之间条件独立,适合高维稀疏文本分类 ✓ 正确答案
# 18. 网格搜索、随机搜索与贝叶斯优化的差异,超参数调优与模型选择如何组织? A 网格搜索在高维空间效率最高,是默认首选 B 贝叶斯优化利用历史评估结果构建代理模型,适合昂贵的评估 ✓ 正确答案 C 随机搜索通过代理模型指导采样,评估次数最少 D 超参数选择可直接在测试集上反复进行,结果更准确
# 19. 机器学习项目全流程(数据清洗、建模、评估、上线、监控)的工程要点是什么,数据与特征质量为何最关键? A 特征工程在模型上线后无需监控,因为特征不会漂移 B 数据质量决定模型学习到的规律上限,比模型复杂度更关键 ✓ 正确答案 C 数据清洗只影响训练速度,不影响最终模型效果 D 模型上线后无需再监控,因为训练时已评估过
# 20. 模型上线后的监控,数据漂移(drift)与概念漂移的检测方法(PSI、KS),监控指标与重训触发机制如何设计? A 概念漂移指输入特征分布变化,数据漂移指输入输出映射变化 B PSI 用于比较特征在训练与当前分布上的差异,超阈值提示数据漂移 ✓ 正确答案 C PSI 值越大表示分布越稳定,应降低重训频率 D KS 检验用于衡量模型预测准确率,与分布漂移无关