深度学习与神经网络基础

共 20 题
#

1. 感知机为什么不能解决异或问题,多层感知机加入非线性激活函数后能力如何提升?

A 感知机可以解决 XOR 问题,因为它是线性模型
B 多层感知机若不加非线性激活,多层叠加仍等价于单层线性模型 ✓ 正确答案
C XOR 问题可以用一条直线将两类样本分开
D 非线性激活函数只在输出层需要,隐藏层可用线性激活
#

2. 反向传播算法如何用链式法则计算每层梯度,梯度消失与梯度爆炸的成因和常用缓解手段是什么?

A 反向传播用链式法则逐层回传梯度,用于更新各层参数 ✓ 正确答案
B 梯度消失导致底层参数更新过大,梯度爆炸导致参数不更新
C Sigmoid 激活因导数最大不超过 1,能避免梯度消失
D 残差连接会加剧梯度消失,应避免使用
#

3. ReLU、Sigmoid、Tanh、LeakyReLU 等激活函数的特性与选择依据,为什么 ReLU 成为默认选择?

A Sigmoid 输出是零中心的,导数在两端不饱和
B ReLU 负区间梯度为 0,可能产生死亡神经元问题 ✓ 正确答案
C ReLU 计算复杂、收敛慢,因此不作为默认激活函数
D Tanh 在正区间导数恒为 1,能避免梯度消失
#

4. SGD、Momentum、Adam 的更新规则与优缺点,Adam 为什么通常收敛更快、但有时泛化略差?

A SGD 为每个参数自适应调整学习率,收敛最快
B Momentum 不考虑历史梯度,只使用当前梯度
C Adam 通过自适应学习率与动量加速收敛,但有时泛化略差 ✓ 正确答案
D Adam 对学习率极为敏感,必须精确调参
#

5. CNN 的卷积、池化与全连接层各起什么作用,感受野与参数量如何随层数变化?

A 全连接层参数量通常小于卷积层,因为权值共享
B 池化层不会改变空间分辨率,只增加通道数
C 感受野随层数增加而减小,深层只能看到局部
D 卷积层通过权值共享减少参数量,参数量与输入尺寸无关 ✓ 正确答案
#

6. RNN 为什么难以建模长序列,LSTM/GRU 的门控机制如何缓解长期依赖问题?

A RNN 通过细胞状态的加性更新与门控,天然擅长长序列建模
B GRU 比 LSTM 参数更多,门控更复杂
C LSTM 的遗忘门决定保留多少旧细胞状态,缓解了长期依赖 ✓ 正确答案
D 标准 RNN 的梯度随时间连乘不会消失,能建模长序列
#

7. 注意力机制的核心思想是什么,Query/Key/Value 如何通过相似度加权得到上下文表示?

A 注意力通过对所有输入等权平均,得到上下文表示
B Query 与 Key 计算相似度,经 Softmax 归一化后对 Value 加权求和 ✓ 正确答案
C Value 向量用于表示"关注点",Query 承载实际内容
D 缩放点积是为了放大 Q、K 的相似度差值
#

8. 权重初始化(Xavier/He)与批归一化(BatchNorm)为什么能提升训练稳定性,原理分别是什么?

A Xavier 初始化使信号在前向与反向传播中保持方差稳定,缓解梯度问题 ✓ 正确答案
B BatchNorm 在训练时按单个样本统计,推理时按 batch 统计
C He 初始化适合 Sigmoid 激活,方差设置比 Xavier 更小
D 批归一化会加剧内部协变量偏移,使训练不稳定
#

9. 卷积的 stride、padding 与通道数如何决定输出尺寸与计算量,1×1 卷积的作用是什么?

A stride 越大输出尺寸越大,计算量越大
B 1×1 卷积不改变空间尺寸,但可调整通道数并实现降维 ✓ 正确答案
C padding 只会增大输出尺寸,不会影响计算量
D 输出通道数由输入通道数决定,与卷积核数量无关
#

10. 数据增强、权重衰减与 Dropout 对深度网络过拟合的缓解机制有何不同?

A 数据增强通过约束参数幅值来降低过拟合
B 权重衰减在训练时随机丢弃神经元,强制网络学习冗余特征
C 数据增强与权重衰减的作用机制完全相同,可互换使用
D Dropout 相当于隐式集成多个子网络,降低对特定神经元的依赖 ✓ 正确答案
#

11. 交叉熵损失与对比损失分别适合什么任务,损失函数的选择如何影响优化与表示学习?

A 对比损失让同类样本距离更近、异类更远,适合度量学习任务 ✓ 正确答案
B 交叉熵损失通过度量嵌入相似度来学习表示
C 对比损失适合分类任务,直接监督模型输出类别概率
D 对比损失不需要负样本,对采样策略不敏感
#

12. 词嵌入(Embedding)相比 one-hot 编码的优势是什么,稠密低维向量如何表达语义相似性?

A one-hot 向量稠密低维,能表达词与词的语义相似性
B one-hot 中任意两个词向量正交,无法表达语义关联 ✓ 正确答案
C 词嵌入的相似性可通过语义关系精确计算,与训练无关
D 词嵌入把每个词映射为高维稀疏向量,维度随词表增长
#

13. 模型容量与数据量的匹配原则,小数据场景为什么应选简单模型或预训练模型?

A 数据量小时应选择容量更大的模型,以充分利用数据
B 模型容量与数据量无关,复杂度越高越好
C 简单模型参数量大,容易在有限数据上过拟合
D 小数据场景用预训练模型,可借迁移学习避免过拟合 ✓ 正确答案
#

14. 学习率调度与训练稳定,warmup、余弦退火与阶梯衰减各自的适用场景,学习率与批量大小如何联动调整?

A warmup 在训练后期把学习率调大,以跳出局部最优
B 余弦退火在训练初期学习率最大,训练后期平滑下降 ✓ 正确答案
C 增大批量时通常应同步降低学习率,避免梯度估计不准
D 阶梯衰减曲线平滑,适合短暂的训练过程
#

15. 梯度裁剪与梯度累积,梯度爆炸时梯度裁剪的作用,小显存下梯度累积与真正增大批量在统计上是否等价?

A 梯度裁剪通过增大梯度范数来加速训练
B 梯度累积得到的梯度与真实大 batch 梯度在方向上完全无偏但数值恒等
C 梯度累积把多个小 batch 的梯度累加后更新,可在小显存模拟大 batch 训练 ✓ 正确答案
D 梯度累积加快训练速度,因为参数更新次数更频繁
#

16. 批归一化在训练与推理的差异,训练时按 batch 统计、推理时用滑动均值,BatchNorm 与 LayerNorm 的适用场景差异如何?

A BatchNorm 推理时仍使用当前 batch 的均值与方差
B BatchNorm 训练时用 batch 统计量,推理时用全局滑动统计量 ✓ 正确答案
C LayerNorm 依赖 batch 大小,batch 小时不稳定
D LayerNorm 跨 batch 样本归一化,适合 CNN 图像任务
#

17. 损失函数的数值稳定性,Softmax 与交叉熵的数值实现(LogSumExp)、标签平滑的作用与对过拟合的抑制如何?

A 标签平滑把 one-hot 标签改得更极端,加剧模型过拟合
B LogSumExp 通过先减去最大值避免 exp 溢出,且不改变结果 ✓ 正确答案
C Softmax 的指数运算在输入很小时溢出,无法规避
D 标签平滑会显著降低模型准确率,因此不被使用
#

18. 迁移学习与微调,预训练模型为什么能迁移到下游任务,冻结底层/微调全层的取舍依据是什么?

A 预训练模型底层学到的是任务特定的高级特征,无法迁移
B 下游数据充足时应冻结底层,以保留预训练特征
C 预训练模型底层学到通用低级特征,可迁移到下游任务 ✓ 正确答案
D 微调时底层参数应使用最大学习率,以快速适配
#

19. 模型压缩的剪枝、量化与知识蒸馏各自思路与适用场景,部署时的精度-速度权衡如何评估?

A 三种压缩方法都必然大幅降低精度,无法在部署中使用
B 剪枝通过训练一个更大的教师模型来压缩学生模型
C 知识蒸馏直接删除不重要的权重,减少参数
D 量化把权重压缩到低精度,可减小体积并加速推理 ✓ 正确答案
#

20. 训练复现性工程,随机种子、确定性算法与版本固定如何保证实验结果可复现,与工程 CI 如何衔接?

A 固定随机种子即可完全消除 GPU 运算的不确定性,无需其他设置
B 启用确定性算法并固定软件版本,可减少运行间差异 ✓ 正确答案
C 只要记录超参数,无需记录代码版本与数据版本
D CUDA 版本与训练结果无关,无需固定