模型能力评估与选型与检索增强生成 RAG

共 48 题
#

1. RAGAS/TruLens 的检索与生成指标如何与业务指标联动,评估集构建与阈值设定如何避免分数虚高?

A 评估指标分数越高,业务指标一定越好
B 评估集应只包含模型擅长回答的简单样本
C 技术指标应与业务指标建立映射,并人工校准阈值 ✓ 正确答案
D 阈值设定不需考虑业务结果,只追求召回率
#

2. OpenAI o1 / o3 推理模型的真实成本与价值

A 推理模型在所有任务上都优于普通模型
B 推理模型因测试时计算而 token 成本更高,适合复杂推理任务 ✓ 正确答案
C 推理模型输出固定,成本与普通模型相同
D 推理模型不需要设置思考链预算
#

3. 中文场景下模型选型的真实工程经验(ERNIE、文心、智谱等)

A 中文模型选型只需看英文通用榜单
B 所有中文模型能力完全相同
C 中文场景需结合中文业务评测、合规与数据驻留综合选型 ✓ 正确答案
D 中文场景不需要考虑备案合规
#

4. 多模态模型在 OCR、文档理解场景的真实可用性

A 多模态模型可替代传统 OCR,但复杂版面仍需分层方案与兜底 ✓ 正确答案
B 多模态模型能完美处理所有文档
C 多模态模型成本低、延迟低
D 文档理解不需要预处理
#

5. 如何为不同任务选择合适基准(MMLU、HumanEval、GSM8K 等)的真实边界

A MMLU 满分即可代表模型业务能力
B 基准用于快速筛选,需结合业务自建评测集验证 ✓ 正确答案
C 基准分数与业务表现完全一致
D 一个基准可以覆盖所有能力维度
#

6. 小模型(SLM)与大模型(LLM)的真实选型依据

A 大模型在所有场景都优于小模型
B 选型只需考虑模型大小
C 小模型无法用于任何生产场景
D 小模型适合简单任务,大模型适合复杂任务,可用路由分级 ✓ 正确答案
#

7. 开源模型(Llama 3.1 405B、Mistral Large、Qwen 2.5 72B)在企业私有化部署的真实成本

A 私有化部署永远比 API 便宜
B 72B 模型只需 1 张普通 GPU 即可运行
C 私有化成本含硬件、运维与人力,需用 TCO 对比 API ✓ 正确答案
D 私有化部署无需考虑 GPU 利用率
#

8. 开源模型(Llama、Mistral、Qwen、DeepSeek-V3)的真实部署经验

A 开源模型部署无需选推理框架
B vLLM 等框架用连续批处理提升吞吐,需压测验证真实性能 ✓ 正确答案
C 量化一定无损,可随意使用
D 部署后无需监控显存与延迟
#

9. 模型微调(Fine-tuning)的真实收益与过拟合风险

A 微调可以可靠地注入新知识
B 微调完全替代 RAG
C 微调数据越多越好,无副作用
D 微调塑形格式与风格,存在过拟合风险,需用留存集评测 ✓ 正确答案
#

10. 领域微调(Legal、Medical、Finance 等)的真实 ROI 与长期价值如何评估,什么条件下才值得投入?

A 领域微调永远值得投入
B 领域微调需高频任务、足量数据与格式需求,否则不如 RAG ✓ 正确答案
C 领域微调无成本
D 微调一次即可长期复用,无需更新
#

11. 代码模型(Codex、Cursor、Copilot)的真实编码提升

A AI 编程工具可完全替代程序员
B 代码模型在补全与重构上提升明显,复杂任务仍需人工把关 ✓ 正确答案
C AI 编码提升与上下文管理无关
D 代码模型生成的代码绝对可靠
#

12. 多模态模型统一处理文本/图像/音频在哪些场景带来真实收益,输入解析失败与成本如何兜底?

A 多模态统一处理有收益,但需做输入失败兜底与内容分级控成本 ✓ 正确答案
B 多模态模型可无限处理任何输入
C 多模态模型不会失败
D 无需考虑多模态成本
#

13. 小模型蒸馏在成本、延迟与离线场景的真实价值,能力损失边界如何用任务评测确定是否值得部署?

A 蒸馏小模型完全保留大模型能力
B 蒸馏没有任何能力损失
C 蒸馏小模型有价值,但需用任务评测确定损失边界是否值得 ✓ 正确答案
D 蒸馏小模型不能用于生产
#

14. 推理模型增加测试时计算在哪些任务上收益明显,延迟与成本预算如何设定,何时应关闭思考链?

A 测试时计算在推理密集任务上收益明显,简单任务应关闭思考链 ✓ 正确答案
B 测试时计算在所有任务上都收益明显
C 测试时计算无成本
D 思考链应始终开启
#

15. 长上下文模型的窗口利用率与注意力、缓存成本如何权衡,什么场景应切长窗口而非 RAG 或摘要?

A 长窗口成本高且中部召回差,信息密集依赖时用长窗口,否则用 RAG ✓ 正确答案
B 长上下文窗口越大越好,成本无需考虑
C 长窗口没有注意力成本
D RAG 永远优于长窗口
#

16. 小模型(Phi-3.5、Gemma 2)的真实部署价值

A 小模型能力与大模型完全一致
B 小模型适合简单任务,可低成本本地部署,复杂任务交给大模型 ✓ 正确答案
C 小模型无法部署
D 小模型只能用于演示
#

17. 评测集中数据污染(Contamination)的检测方法

A 数据污染不影响评测结果
B 污染检测无法实现
C 评测集永远不能更换
D 数据污染会导致分数虚高,可用 n-gram 检测与自建私密评测集缓解 ✓ 正确答案
#

18. 模型升级时的回退(Rollback)策略与触发条件

A 模型升级无需回退能力
B 回退会丢失所有数据
C 模型升级应采用灰度发布,并预设回退阈值与一键回退预案 ✓ 正确答案
D 升级失败只能重启服务
#

19. Advanced RAG(Self-RAG、Corrective-RAG)的真实应用

A Self-RAG 无任何额外成本
B Advanced RAG 永远优于基础 RAG
C Corrective-RAG 在检索结果差时纠正,但增加复杂度与延迟 ✓ 正确答案
D Advanced RAG 不需要检索
#

20. Embedding 选型与领域微调的真实收益

A 所有 Embedding 模型效果相同
B Embedding 微调无成本
C Embedding 选型看语言与检索质量,领域微调需用指标评估收益 ✓ 正确答案
D 领域 Embedding 不需要评测
#

21. HyDE(Hypothetical Document Embeddings)的真实提升幅度

A HyDE 在查询-文档鸿沟大时提升明显,但增加一次 LLM 调用成本 ✓ 正确答案
B HyDE 在任何场景都大幅提升检索
C HyDE 不调用 LLM
D HyDE 只用于英文
#

22. LlamaIndex 0.10+ vs LangChain 0.3 的真实对比

A LlamaIndex 擅长 RAG,LangChain 擅长通用编排,按需选型 ✓ 正确答案
B LlamaIndex 与 LangChain 功能完全一样
C LangChain 不提供任何 Agent 能力
D LlamaIndex 不支持检索
#

23. LongRAG(长文档 RAG)的真实工程方案

A 长文档直接整段灌入即可
B 长文档切分不会影响召回
C 长文档 RAG 需分层切分、小粒度检索加大粒度上下文与重排序 ✓ 正确答案
D 长文档 RAG 无需重排序
#

24. Multimodal RAG 的真实生产应用

A Multimodal RAG 只需处理文本
B 图像检索无需 embedding
C 多模态 RAG 无法生产化
D Multimodal RAG 用于图文混合检索,需处理对齐与高成本 ✓ 正确答案
#

25. Qdrant 1.10+ / Milvus 2.4+ 的真实生产经验

A Qdrant 与 Milvus 完全等价
B Qdrant 轻量适合中小规模,Milvus 适合大规模分布式,均需压测 ✓ 正确答案
C 向量库无需索引调优
D 向量库不需要备份
#

26. RAG 与长上下文模型的真实替代关系判断

A RAG 与长上下文完全冲突
B RAG 与长上下文互补,按信息规模、相关性、预算判断 ✓ 正确答案
C 长上下文成本更低
D 长上下文检索质量一定差
#

27. RAG 中的引用追踪(Citation Tracking)工程实现

A 引用追踪只影响展示,不影响可信度
B 引用无需验证
C 模型不会编造引用
D 引用追踪需保留来源、生成时引用并校验真实性,提升可审计性 ✓ 正确答案
#

28. RAG 在中文场景的真实表现差异(jieba、HanLP 分词等)

A 中文与英文 RAG 完全一样
B 中文 RAG 需注意切分语义与中文 Embedding,分词辅助关键词检索 ✓ 正确答案
C 中文无需分词
D 中文检索质量无法评测
#

29. 元数据过滤(Metadata Filtering)在企业 RAG 的真实价值

A 元数据过滤可缩小范围、控制权限与时效,提升企业 RAG 准确性与合规 ✓ 正确答案
B 元数据过滤不影响检索质量
C 元数据过滤无法实现
D 元数据过滤只在英文中有效
#

30. 图结构 RAG(GraphRAG)的真实场景与复杂度

A GraphRAG 适合所有场景
B GraphRAG 成本极低
C GraphRAG 无需建图
D GraphRAG 适合多跳关系推理,但建图与查询成本高,常用图+向量混合 ✓ 正确答案
#

31. 文档切分(Chunking)策略对召回质量的真实影响

A 切分策略影响召回质量,需按文档结构与评测调优,常用父子切分 ✓ 正确答案
B 切分粒度不影响召回质量
C 切分越小越好
D 切分越大越好
#

32. Agentic RAG 的多步检索-重写-验证相比单轮 RAG 在复杂查询上的收益与失败模式,评估指标如何定义?

A Agentic RAG 提升复杂查询准确,但需防循环失控,评估看成功率与成本 ✓ 正确答案
B Agentic RAG 无失败风险
C Agentic RAG 与单轮 RAG 完全一样
D Agentic RAG 无需步骤预算
#

33. RAG 缓存(语义缓存/KV 缓存)的命中判定与一致性策略如何设计,更新与失效如何避免过期检索结果?

A 语义缓存不会误命中
B KV 缓存与语义缓存完全相同
C 缓存无需失效
D 缓存需处理命中判定与一致性,数据更新时级联失效避免过期 ✓ 正确答案
#

34. RAG 中的 Prompt 模板与版本管理

A Prompt 模板无需管理
B Prompt 模板需版本化、可追溯可回滚,改动后走回归评测 ✓ 正确答案
C 模板改动不影响结果
D 模板不能回滚
#

35. RAG 系统的 A/B 测试真实工程经验

A RAG A/B 测试无需随机分流
B 样本量无所谓
C A/B 测试只看生成分数
D RAG A/B 测试要随机分流、分质量与业务指标,先离线后在线 ✓ 正确答案
#

36. RAG 评估的真实指标体系(Faithfulness、Relevance、Recall)

A Faithfulness 衡量检索是否覆盖全部信息
B 三个指标完全等价
C Faithfulness 看生成忠实,Relevance 看相关,Recall 看召回覆盖 ✓ 正确答案
D 指标无任何局限
#

37. 增量索引(Incremental Indexing)的真实工程实现

A 增量索引只能全量重建
B 增量索引只更新变更部分,靠变更检测与按 ID upsert,需管理一致性 ✓ 正确答案
C 增量索引无需监控
D 增量索引不支持删除
#

38. 长文档 RAG(LongReranker、Lost in the Middle)的真实解决方案

A Lost in the Middle 需用重排序、关键信息前置与分层检索缓解 ✓ 正确答案
B 长上下文对中部信息利用完全无差
C 重排序不影响长文档问答
D 长文档无需处理
#

39. Anthropic Claude 3.5/4 的真实生产稳定性

A Claude 稳定性总体良好,但需监控波动、处理限流与多供应商兜底 ✓ 正确答案
B Claude 生产绝对稳定,无需监控
C Claude 不能用于生产
D 限流无需处理
#

40. GPT-4o 与 Claude 3.5 Sonnet 在代码生成场景的真实差异

A GPT-4o 与 Claude 3.5 代码能力完全相同
B Claude 在长上下文代码与审查上强,GPT-4o 生态均衡,需业务评测选型 ✓ 正确答案
C Claude 不能生成代码
D 选型只需看一个榜单
#

41. 闭源 API 在生产环境的真实 SLA 与故障模式

A 闭源 API 的 SLA 保证输出质量
B 闭源 API SLA 只覆盖可用性,需设计超时重试、多供应商与熔断降级 ✓ 正确答案
C 闭源 API 不会故障
D 无需监控闭源 API
#

42. Prompt tuning 与 LoRA 的真实适用边界

A Prompt tuning 与 LoRA 完全等价
B LoRA 不训练任何参数
C Prompt tuning 轻量但表达受限,LoRA 更强需数据与算力,按需选择 ✓ 正确答案
D Prompt tuning 一定优于 LoRA
#

43. 闭源 API(GPT、Claude、Gemini)的真实稳定性差异

A 三家闭源 API 稳定性完全一致
B 稳定性无需评估
C Gemini 无法使用
D 三家稳定性受任务与区域影响,生产宜多供应商路由+监控 ✓ 正确答案
#

44. RAG 的真实延迟边界(端到端 P99)

A RAG P99 由检索+生成构成,用流式、缓存、路由与并行优化 ✓ 正确答案
B RAG 延迟只取决于 LLM 生成
C 延迟无法优化
D P99 不需要关注
#

45. 递归检索(Recursive Retrieval)与多跳问答(Multi-Hop QA)

A 多跳问答只需一次检索
B 递归检索无成本
C 多跳问答无需推理
D 递归检索与多跳问答应对复杂查询,但需步数预算与反思防失控 ✓ 正确答案
#

46. Function Calling 的真实成功率

A Function Calling 成功率 100%
B Function Calling 无法提升
C 工具描述不影响成功率
D Function Calling 成功率受工具描述与输入影响,用清晰 schema、示例与重试提升 ✓ 正确答案
#

47. Tool Use 与 Function Calling 的真实失败模式

A Tool Use 不会失败
B 工具失败无法观测
C 只有模型会失败
D Tool Use 失败模式包括参数错误、选择错误与循环,需日志诊断与重试兜底 ✓ 正确答案
#

48. 语义缓存(Semantic Cache)的真实命中率与维护

A 语义缓存命中率取决查询重复度与阈值,需防误命中并动态调阈值 ✓ 正确答案
B 语义缓存命中率与查询重复度无关
C 阈值越高越好
D 语义缓存无需维护