大模型与 Transformer 基础

共 20 题
#

1. Transformer 的整体结构(Encoder/Decoder、多头自注意力、前馈网络、位置编码)是如何组织的?

A 位置编码是可选组件,去掉后注意力仍能感知顺序
B 每个 Encoder 层只包含自注意力,不含前馈网络
C Decoder 的交叉注意力用于与 Encoder 输出的信息交互 ✓ 正确答案
D Encoder 的自注意力是掩码的,防止看到未来位置
#

2. 自注意力的时间复杂度为什么是 O(n²),长文本输入的主要瓶颈在哪里,有哪些近似/稀疏注意力方案?

A 自注意力的 n×n 注意力矩阵使时间与空间复杂度均为 O(n²) ✓ 正确答案
B 自注意力时间复杂度为 O(n log n),n 为特征维度
C 滑动窗口注意力让每个 token 关注全局所有位置,复杂度更高
D 长文本瓶颈来自前馈网络,与注意力矩阵无关
#

3. KV Cache 的作用是什么,解码阶段为什么必须缓存 Key/Value,其显存开销如何估算?

A KV Cache 缓存的是注意力分数矩阵,用于避免重复前向
B KV Cache 显存开销与序列长度无关,只取决于层数
C 解码时缓存历史 Key/Value,把注意力计算复杂度从 O(n²) 降为 O(n) ✓ 正确答案
D KV Cache 主要增加显存,但不会影响推理吞吐
#

4. 为什么大模型生成是访存受限(memory-bound)而非算力受限,与训练阶段的计算特点有何不同?

A 生成阶段计算密集,瓶颈在 GPU 算力而非显存带宽
B 训练阶段是访存受限,因为 batch 内 token 共享权重
C 生成阶段每个 token 需读取全部权重但计算量小,因此是访存受限 ✓ 正确答案
D 量化提升生成吞吐主要通过增加计算量
#

5. INT8/INT4 量化在推理部署中的收益与精度影响是什么,量化感知训练与训练后量化的区别?

A INT4 量化比 INT8 精度损失更小,应优先使用
B 量化会增大模型体积与显存占用
C 训练后量化(PTQ)无需重新训练,但精度损失通常大于 QAT ✓ 正确答案
D 量化感知训练在推理后校正权重,不参与训练过程
#

6. RAG 的基本流程(文档切分、向量化、相似度检索、上下文拼接)为什么能缓解幻觉与知识过时问题?

A RAG 主要解决推理速度问题,与知识时效无关
B RAG 把知识固化在模型参数中,无法更新知识
C RAG 的检索目的是压缩模型参数量
D RAG 通过检索外部知识并拼接入上下文,使生成有事实依据,缓解幻觉 ✓ 正确答案
#

7. 预训练与微调的区别是什么,为什么"海量预训练加任务微调"范式优于直接在下游数据上训练?

A 预训练的目标是直接完成下游任务,无需微调
B 微调从随机初始化开始,与预训练无关
C 直接在下游数据上训练通常比预训练加微调效果更好
D 预训练在通用语料上学习通用知识,微调用少量下游数据适配任务 ✓ 正确答案
#

8. 绝对位置编码与旋转位置编码(RoPE)的差异,长度外推(extrapolation)问题是什么?

A 绝对位置编码直接编码相对距离,外推能力最强
B 位置编码只影响训练,不影响推理长度
C 长度外推问题指训练时长度过长导致模型无法收敛
D RoPE 通过旋转使注意力蕴含相对位置信息,外推能力优于简单绝对编码 ✓ 正确答案
#

9. 多头注意力为什么比单头更好,不同头是否倾向于关注不同类型的依赖关系?

A 不同头倾向于关注不同类型的依赖关系,增强模型表达能力 ✓ 正确答案
B 多头注意力把所有头共享同一套 Q、K、V 投影
C 多头注意力比单头参数量更少,表达能力更弱
D 多头注意力会显著降低模型捕捉远距离依赖的能力
#

10. 连续批处理(continuous batching)与 PagedAttention 解决推理吞吐的什么问题?

A 连续批处理在请求完成时释放资源并立即加入新请求,提升吞吐 ✓ 正确答案
B 静态批处理让长请求不阻塞其他请求,吞吐更高
C PagedAttention 按连续内存分配 KV Cache,避免碎片
D 连续批处理主要优化 KV Cache 显存,与调度无关
#

11. 张量并行与流水线并行在分布式训练/推理中的分工,通信量与负载均衡如何权衡?

A 张量并行按层切分到不同 GPU,通信量小但有空泡
B 流水线并行把单层权重切分到多 GPU,每层都需 AllReduce
C 张量并行是层内切分,通信频繁;流水线并行是层间切分,通信较少 ✓ 正确答案
D 张量并行与流水线并行都只切分数据,不切分模型
#

12. 幻觉的主要成因是什么,训练数据质量、解码策略与检索增强分别在什么层面缓解?

A 幻觉只由解码随机性导致,与训练数据无关
B 检索增强通过提供外部事实依据约束生成,缓解幻觉 ✓ 正确答案
C 提高温度能减少幻觉,因为生成更保守
D 训练数据质量对幻觉没有任何影响
#

13. 贪心解码、beam search 与温度采样对生成质量与多样性的影响,什么场景该用哪种?

A 温度采样温度越高分布越尖锐,生成越确定
B beam search 探索多条路径,在翻译摘要等任务上质量高但多样性低 ✓ 正确答案
C 贪心解码能避免重复,多样性最好
D 开放式创作应使用 beam search 以获得确定输出
#

14. Tokenizer 与 BPE,为什么需要子词分词,BPE 的合并规则与词表大小对压缩率、参数量与生成长度的影响如何?

A 子词分词能覆盖未登录词,但词表必然大于整词分词
B 词表越大,嵌入层参数量越小,训练成本越低
C BPE 每次合并语料中频率最高的相邻 token 对,直到达到目标词表大小 ✓ 正确答案
D 字符级分词压缩率最高,最适合作为默认分词
#

15. 上下文窗口与长文本工程,训练窗口与推理窗口的关系,超窗文本如何用滑动窗口/摘要/外挂检索处理,长度外推的局限如何?

A 推理窗口可以轻易超过训练窗口,且性能不受影响
B 滑动窗口处理能完整保留所有跨窗口信息
C 长度外推完全不受位置编码限制,可无限扩展
D 超窗文本用 RAG 外挂检索可只提取相关片段,避免整段超长 ✓ 正确答案
#

16. 嵌入(Embedding)模型与语义检索,文本向量化如何工作,与 Token 表示的区别,在 RAG 检索质量中的工程要点如何?

A 语义检索只能做关键词匹配,无法处理语义相似
B Token 表示与文本嵌入本质相同,都是整段文本一个向量
C 文本嵌入把整段文本映射为稠密向量,可用于语义相似度检索 ✓ 正确答案
D 检索质量与嵌入模型无关,只由提示词决定
#

17. 模型规模定律(Scaling Laws)与"涌现能力"的基本概念是什么,它们对训练预算的指导意义?

A 涌现能力与训练预算无关,无法通过投入规模获得
B 涌现能力随模型规模平滑线性增长,无阈值效应
C Scaling Laws 表明增加参数量与增加数据量相互独立,无需平衡
D Scaling Laws 指出性能与参数、数据、算力存在可预测的幂律关系 ✓ 正确答案
#

18. LoRA 等参数高效微调(PEFT)为什么只训练低秩增量矩阵,与全量微调的效果差异如何?

A LoRA 训练低秩增量矩阵 BA 加到原权重上,可训练参数大幅减少 ✓ 正确答案
B LoRA 需要更新全部原始权重,训练成本与全量微调相同
C LoRA 因为参数少,效果必然比全量微调差很多
D 低秩增量假设权重变化散布在全部维度,无法压缩
#

19. 大模型服务的关键指标(TTFT、TPOT、吞吐、并发)如何定义,它们与批大小和显存的关系是什么?

A TTFT 指生成每个 token 的平均时间,反映生成速度
B 并发只取决于请求数量,与显存大小无关
C 吞吐指单个请求的响应延迟,与并发无关
D 增大批大小通常提升吞吐,但会增加 KV 缓存显存占用 ✓ 正确答案
#

20. 多模态输入处理,图像/音频如何被离散化为 patch/帧序列与文本对齐,模态对齐对推理显存与延迟的影响如何?

A 模态对齐不会改变序列长度,对推理延迟无影响
B 音频帧通常比文本 token 更少,因此对显存影响很小
C 图像被切分为 patch 并投影为向量,与文本 token 统一建模 ✓ 正确答案
D 视觉 token 数量不影响 KV Cache 与显存占用