# 1. 感知机为什么不能解决异或问题,多层感知机加入非线性激活函数后能力如何提升? A 感知机可以解决 XOR 问题,因为它是线性模型 B 多层感知机若不加非线性激活,多层叠加仍等价于单层线性模型 ✓ 正确答案 C XOR 问题可以用一条直线将两类样本分开 D 非线性激活函数只在输出层需要,隐藏层可用线性激活
# 2. 反向传播算法如何用链式法则计算每层梯度,梯度消失与梯度爆炸的成因和常用缓解手段是什么? A 反向传播用链式法则逐层回传梯度,用于更新各层参数 ✓ 正确答案 B 梯度消失导致底层参数更新过大,梯度爆炸导致参数不更新 C Sigmoid 激活因导数最大不超过 1,能避免梯度消失 D 残差连接会加剧梯度消失,应避免使用
# 3. ReLU、Sigmoid、Tanh、LeakyReLU 等激活函数的特性与选择依据,为什么 ReLU 成为默认选择? A Sigmoid 输出是零中心的,导数在两端不饱和 B ReLU 负区间梯度为 0,可能产生死亡神经元问题 ✓ 正确答案 C ReLU 计算复杂、收敛慢,因此不作为默认激活函数 D Tanh 在正区间导数恒为 1,能避免梯度消失
# 4. SGD、Momentum、Adam 的更新规则与优缺点,Adam 为什么通常收敛更快、但有时泛化略差? A SGD 为每个参数自适应调整学习率,收敛最快 B Momentum 不考虑历史梯度,只使用当前梯度 C Adam 通过自适应学习率与动量加速收敛,但有时泛化略差 ✓ 正确答案 D Adam 对学习率极为敏感,必须精确调参
# 5. CNN 的卷积、池化与全连接层各起什么作用,感受野与参数量如何随层数变化? A 全连接层参数量通常小于卷积层,因为权值共享 B 池化层不会改变空间分辨率,只增加通道数 C 感受野随层数增加而减小,深层只能看到局部 D 卷积层通过权值共享减少参数量,参数量与输入尺寸无关 ✓ 正确答案
# 6. RNN 为什么难以建模长序列,LSTM/GRU 的门控机制如何缓解长期依赖问题? A RNN 通过细胞状态的加性更新与门控,天然擅长长序列建模 B GRU 比 LSTM 参数更多,门控更复杂 C LSTM 的遗忘门决定保留多少旧细胞状态,缓解了长期依赖 ✓ 正确答案 D 标准 RNN 的梯度随时间连乘不会消失,能建模长序列
# 7. 注意力机制的核心思想是什么,Query/Key/Value 如何通过相似度加权得到上下文表示? A 注意力通过对所有输入等权平均,得到上下文表示 B Query 与 Key 计算相似度,经 Softmax 归一化后对 Value 加权求和 ✓ 正确答案 C Value 向量用于表示"关注点",Query 承载实际内容 D 缩放点积是为了放大 Q、K 的相似度差值
# 8. 权重初始化(Xavier/He)与批归一化(BatchNorm)为什么能提升训练稳定性,原理分别是什么? A Xavier 初始化使信号在前向与反向传播中保持方差稳定,缓解梯度问题 ✓ 正确答案 B BatchNorm 在训练时按单个样本统计,推理时按 batch 统计 C He 初始化适合 Sigmoid 激活,方差设置比 Xavier 更小 D 批归一化会加剧内部协变量偏移,使训练不稳定
# 9. 卷积的 stride、padding 与通道数如何决定输出尺寸与计算量,1×1 卷积的作用是什么? A stride 越大输出尺寸越大,计算量越大 B 1×1 卷积不改变空间尺寸,但可调整通道数并实现降维 ✓ 正确答案 C padding 只会增大输出尺寸,不会影响计算量 D 输出通道数由输入通道数决定,与卷积核数量无关
# 10. 数据增强、权重衰减与 Dropout 对深度网络过拟合的缓解机制有何不同? A 数据增强通过约束参数幅值来降低过拟合 B 权重衰减在训练时随机丢弃神经元,强制网络学习冗余特征 C 数据增强与权重衰减的作用机制完全相同,可互换使用 D Dropout 相当于隐式集成多个子网络,降低对特定神经元的依赖 ✓ 正确答案
# 11. 交叉熵损失与对比损失分别适合什么任务,损失函数的选择如何影响优化与表示学习? A 对比损失让同类样本距离更近、异类更远,适合度量学习任务 ✓ 正确答案 B 交叉熵损失通过度量嵌入相似度来学习表示 C 对比损失适合分类任务,直接监督模型输出类别概率 D 对比损失不需要负样本,对采样策略不敏感
# 12. 词嵌入(Embedding)相比 one-hot 编码的优势是什么,稠密低维向量如何表达语义相似性? A one-hot 向量稠密低维,能表达词与词的语义相似性 B one-hot 中任意两个词向量正交,无法表达语义关联 ✓ 正确答案 C 词嵌入的相似性可通过语义关系精确计算,与训练无关 D 词嵌入把每个词映射为高维稀疏向量,维度随词表增长
# 13. 模型容量与数据量的匹配原则,小数据场景为什么应选简单模型或预训练模型? A 数据量小时应选择容量更大的模型,以充分利用数据 B 模型容量与数据量无关,复杂度越高越好 C 简单模型参数量大,容易在有限数据上过拟合 D 小数据场景用预训练模型,可借迁移学习避免过拟合 ✓ 正确答案
# 14. 学习率调度与训练稳定,warmup、余弦退火与阶梯衰减各自的适用场景,学习率与批量大小如何联动调整? A warmup 在训练后期把学习率调大,以跳出局部最优 B 余弦退火在训练初期学习率最大,训练后期平滑下降 ✓ 正确答案 C 增大批量时通常应同步降低学习率,避免梯度估计不准 D 阶梯衰减曲线平滑,适合短暂的训练过程
# 15. 梯度裁剪与梯度累积,梯度爆炸时梯度裁剪的作用,小显存下梯度累积与真正增大批量在统计上是否等价? A 梯度裁剪通过增大梯度范数来加速训练 B 梯度累积得到的梯度与真实大 batch 梯度在方向上完全无偏但数值恒等 C 梯度累积把多个小 batch 的梯度累加后更新,可在小显存模拟大 batch 训练 ✓ 正确答案 D 梯度累积加快训练速度,因为参数更新次数更频繁
# 16. 批归一化在训练与推理的差异,训练时按 batch 统计、推理时用滑动均值,BatchNorm 与 LayerNorm 的适用场景差异如何? A BatchNorm 推理时仍使用当前 batch 的均值与方差 B BatchNorm 训练时用 batch 统计量,推理时用全局滑动统计量 ✓ 正确答案 C LayerNorm 依赖 batch 大小,batch 小时不稳定 D LayerNorm 跨 batch 样本归一化,适合 CNN 图像任务
# 17. 损失函数的数值稳定性,Softmax 与交叉熵的数值实现(LogSumExp)、标签平滑的作用与对过拟合的抑制如何? A 标签平滑把 one-hot 标签改得更极端,加剧模型过拟合 B LogSumExp 通过先减去最大值避免 exp 溢出,且不改变结果 ✓ 正确答案 C Softmax 的指数运算在输入很小时溢出,无法规避 D 标签平滑会显著降低模型准确率,因此不被使用
# 18. 迁移学习与微调,预训练模型为什么能迁移到下游任务,冻结底层/微调全层的取舍依据是什么? A 预训练模型底层学到的是任务特定的高级特征,无法迁移 B 下游数据充足时应冻结底层,以保留预训练特征 C 预训练模型底层学到通用低级特征,可迁移到下游任务 ✓ 正确答案 D 微调时底层参数应使用最大学习率,以快速适配
# 19. 模型压缩的剪枝、量化与知识蒸馏各自思路与适用场景,部署时的精度-速度权衡如何评估? A 三种压缩方法都必然大幅降低精度,无法在部署中使用 B 剪枝通过训练一个更大的教师模型来压缩学生模型 C 知识蒸馏直接删除不重要的权重,减少参数 D 量化把权重压缩到低精度,可减小体积并加速推理 ✓ 正确答案
# 20. 训练复现性工程,随机种子、确定性算法与版本固定如何保证实验结果可复现,与工程 CI 如何衔接? A 固定随机种子即可完全消除 GPU 运算的不确定性,无需其他设置 B 启用确定性算法并固定软件版本,可减少运行间差异 ✓ 正确答案 C 只要记录超参数,无需记录代码版本与数据版本 D CUDA 版本与训练结果无关,无需固定