# 1. RAGAS/TruLens 的检索与生成指标如何与业务指标联动,评估集构建与阈值设定如何避免分数虚高? A 评估指标分数越高,业务指标一定越好 B 评估集应只包含模型擅长回答的简单样本 C 技术指标应与业务指标建立映射,并人工校准阈值 ✓ 正确答案 D 阈值设定不需考虑业务结果,只追求召回率
# 2. OpenAI o1 / o3 推理模型的真实成本与价值 A 推理模型在所有任务上都优于普通模型 B 推理模型因测试时计算而 token 成本更高,适合复杂推理任务 ✓ 正确答案 C 推理模型输出固定,成本与普通模型相同 D 推理模型不需要设置思考链预算
# 3. 中文场景下模型选型的真实工程经验(ERNIE、文心、智谱等) A 中文模型选型只需看英文通用榜单 B 所有中文模型能力完全相同 C 中文场景需结合中文业务评测、合规与数据驻留综合选型 ✓ 正确答案 D 中文场景不需要考虑备案合规
# 4. 多模态模型在 OCR、文档理解场景的真实可用性 A 多模态模型可替代传统 OCR,但复杂版面仍需分层方案与兜底 ✓ 正确答案 B 多模态模型能完美处理所有文档 C 多模态模型成本低、延迟低 D 文档理解不需要预处理
# 5. 如何为不同任务选择合适基准(MMLU、HumanEval、GSM8K 等)的真实边界 A MMLU 满分即可代表模型业务能力 B 基准用于快速筛选,需结合业务自建评测集验证 ✓ 正确答案 C 基准分数与业务表现完全一致 D 一个基准可以覆盖所有能力维度
# 6. 小模型(SLM)与大模型(LLM)的真实选型依据 A 大模型在所有场景都优于小模型 B 选型只需考虑模型大小 C 小模型无法用于任何生产场景 D 小模型适合简单任务,大模型适合复杂任务,可用路由分级 ✓ 正确答案
# 7. 开源模型(Llama 3.1 405B、Mistral Large、Qwen 2.5 72B)在企业私有化部署的真实成本 A 私有化部署永远比 API 便宜 B 72B 模型只需 1 张普通 GPU 即可运行 C 私有化成本含硬件、运维与人力,需用 TCO 对比 API ✓ 正确答案 D 私有化部署无需考虑 GPU 利用率
# 8. 开源模型(Llama、Mistral、Qwen、DeepSeek-V3)的真实部署经验 A 开源模型部署无需选推理框架 B vLLM 等框架用连续批处理提升吞吐,需压测验证真实性能 ✓ 正确答案 C 量化一定无损,可随意使用 D 部署后无需监控显存与延迟
# 9. 模型微调(Fine-tuning)的真实收益与过拟合风险 A 微调可以可靠地注入新知识 B 微调完全替代 RAG C 微调数据越多越好,无副作用 D 微调塑形格式与风格,存在过拟合风险,需用留存集评测 ✓ 正确答案
# 10. 领域微调(Legal、Medical、Finance 等)的真实 ROI 与长期价值如何评估,什么条件下才值得投入? A 领域微调永远值得投入 B 领域微调需高频任务、足量数据与格式需求,否则不如 RAG ✓ 正确答案 C 领域微调无成本 D 微调一次即可长期复用,无需更新
# 11. 代码模型(Codex、Cursor、Copilot)的真实编码提升 A AI 编程工具可完全替代程序员 B 代码模型在补全与重构上提升明显,复杂任务仍需人工把关 ✓ 正确答案 C AI 编码提升与上下文管理无关 D 代码模型生成的代码绝对可靠
# 12. 多模态模型统一处理文本/图像/音频在哪些场景带来真实收益,输入解析失败与成本如何兜底? A 多模态统一处理有收益,但需做输入失败兜底与内容分级控成本 ✓ 正确答案 B 多模态模型可无限处理任何输入 C 多模态模型不会失败 D 无需考虑多模态成本
# 13. 小模型蒸馏在成本、延迟与离线场景的真实价值,能力损失边界如何用任务评测确定是否值得部署? A 蒸馏小模型完全保留大模型能力 B 蒸馏没有任何能力损失 C 蒸馏小模型有价值,但需用任务评测确定损失边界是否值得 ✓ 正确答案 D 蒸馏小模型不能用于生产
# 14. 推理模型增加测试时计算在哪些任务上收益明显,延迟与成本预算如何设定,何时应关闭思考链? A 测试时计算在推理密集任务上收益明显,简单任务应关闭思考链 ✓ 正确答案 B 测试时计算在所有任务上都收益明显 C 测试时计算无成本 D 思考链应始终开启
# 15. 长上下文模型的窗口利用率与注意力、缓存成本如何权衡,什么场景应切长窗口而非 RAG 或摘要? A 长窗口成本高且中部召回差,信息密集依赖时用长窗口,否则用 RAG ✓ 正确答案 B 长上下文窗口越大越好,成本无需考虑 C 长窗口没有注意力成本 D RAG 永远优于长窗口
# 16. 小模型(Phi-3.5、Gemma 2)的真实部署价值 A 小模型能力与大模型完全一致 B 小模型适合简单任务,可低成本本地部署,复杂任务交给大模型 ✓ 正确答案 C 小模型无法部署 D 小模型只能用于演示
# 17. 评测集中数据污染(Contamination)的检测方法 A 数据污染不影响评测结果 B 污染检测无法实现 C 评测集永远不能更换 D 数据污染会导致分数虚高,可用 n-gram 检测与自建私密评测集缓解 ✓ 正确答案
# 18. 模型升级时的回退(Rollback)策略与触发条件 A 模型升级无需回退能力 B 回退会丢失所有数据 C 模型升级应采用灰度发布,并预设回退阈值与一键回退预案 ✓ 正确答案 D 升级失败只能重启服务
# 19. Advanced RAG(Self-RAG、Corrective-RAG)的真实应用 A Self-RAG 无任何额外成本 B Advanced RAG 永远优于基础 RAG C Corrective-RAG 在检索结果差时纠正,但增加复杂度与延迟 ✓ 正确答案 D Advanced RAG 不需要检索
# 20. Embedding 选型与领域微调的真实收益 A 所有 Embedding 模型效果相同 B Embedding 微调无成本 C Embedding 选型看语言与检索质量,领域微调需用指标评估收益 ✓ 正确答案 D 领域 Embedding 不需要评测
# 21. HyDE(Hypothetical Document Embeddings)的真实提升幅度 A HyDE 在查询-文档鸿沟大时提升明显,但增加一次 LLM 调用成本 ✓ 正确答案 B HyDE 在任何场景都大幅提升检索 C HyDE 不调用 LLM D HyDE 只用于英文
# 22. LlamaIndex 0.10+ vs LangChain 0.3 的真实对比 A LlamaIndex 擅长 RAG,LangChain 擅长通用编排,按需选型 ✓ 正确答案 B LlamaIndex 与 LangChain 功能完全一样 C LangChain 不提供任何 Agent 能力 D LlamaIndex 不支持检索
# 23. LongRAG(长文档 RAG)的真实工程方案 A 长文档直接整段灌入即可 B 长文档切分不会影响召回 C 长文档 RAG 需分层切分、小粒度检索加大粒度上下文与重排序 ✓ 正确答案 D 长文档 RAG 无需重排序
# 24. Multimodal RAG 的真实生产应用 A Multimodal RAG 只需处理文本 B 图像检索无需 embedding C 多模态 RAG 无法生产化 D Multimodal RAG 用于图文混合检索,需处理对齐与高成本 ✓ 正确答案
# 25. Qdrant 1.10+ / Milvus 2.4+ 的真实生产经验 A Qdrant 与 Milvus 完全等价 B Qdrant 轻量适合中小规模,Milvus 适合大规模分布式,均需压测 ✓ 正确答案 C 向量库无需索引调优 D 向量库不需要备份
# 26. RAG 与长上下文模型的真实替代关系判断 A RAG 与长上下文完全冲突 B RAG 与长上下文互补,按信息规模、相关性、预算判断 ✓ 正确答案 C 长上下文成本更低 D 长上下文检索质量一定差
# 27. RAG 中的引用追踪(Citation Tracking)工程实现 A 引用追踪只影响展示,不影响可信度 B 引用无需验证 C 模型不会编造引用 D 引用追踪需保留来源、生成时引用并校验真实性,提升可审计性 ✓ 正确答案
# 28. RAG 在中文场景的真实表现差异(jieba、HanLP 分词等) A 中文与英文 RAG 完全一样 B 中文 RAG 需注意切分语义与中文 Embedding,分词辅助关键词检索 ✓ 正确答案 C 中文无需分词 D 中文检索质量无法评测
# 29. 元数据过滤(Metadata Filtering)在企业 RAG 的真实价值 A 元数据过滤可缩小范围、控制权限与时效,提升企业 RAG 准确性与合规 ✓ 正确答案 B 元数据过滤不影响检索质量 C 元数据过滤无法实现 D 元数据过滤只在英文中有效
# 30. 图结构 RAG(GraphRAG)的真实场景与复杂度 A GraphRAG 适合所有场景 B GraphRAG 成本极低 C GraphRAG 无需建图 D GraphRAG 适合多跳关系推理,但建图与查询成本高,常用图+向量混合 ✓ 正确答案
# 31. 文档切分(Chunking)策略对召回质量的真实影响 A 切分策略影响召回质量,需按文档结构与评测调优,常用父子切分 ✓ 正确答案 B 切分粒度不影响召回质量 C 切分越小越好 D 切分越大越好
# 32. Agentic RAG 的多步检索-重写-验证相比单轮 RAG 在复杂查询上的收益与失败模式,评估指标如何定义? A Agentic RAG 提升复杂查询准确,但需防循环失控,评估看成功率与成本 ✓ 正确答案 B Agentic RAG 无失败风险 C Agentic RAG 与单轮 RAG 完全一样 D Agentic RAG 无需步骤预算
# 33. RAG 缓存(语义缓存/KV 缓存)的命中判定与一致性策略如何设计,更新与失效如何避免过期检索结果? A 语义缓存不会误命中 B KV 缓存与语义缓存完全相同 C 缓存无需失效 D 缓存需处理命中判定与一致性,数据更新时级联失效避免过期 ✓ 正确答案
# 34. RAG 中的 Prompt 模板与版本管理 A Prompt 模板无需管理 B Prompt 模板需版本化、可追溯可回滚,改动后走回归评测 ✓ 正确答案 C 模板改动不影响结果 D 模板不能回滚
# 35. RAG 系统的 A/B 测试真实工程经验 A RAG A/B 测试无需随机分流 B 样本量无所谓 C A/B 测试只看生成分数 D RAG A/B 测试要随机分流、分质量与业务指标,先离线后在线 ✓ 正确答案
# 36. RAG 评估的真实指标体系(Faithfulness、Relevance、Recall) A Faithfulness 衡量检索是否覆盖全部信息 B 三个指标完全等价 C Faithfulness 看生成忠实,Relevance 看相关,Recall 看召回覆盖 ✓ 正确答案 D 指标无任何局限
# 37. 增量索引(Incremental Indexing)的真实工程实现 A 增量索引只能全量重建 B 增量索引只更新变更部分,靠变更检测与按 ID upsert,需管理一致性 ✓ 正确答案 C 增量索引无需监控 D 增量索引不支持删除
# 38. 长文档 RAG(LongReranker、Lost in the Middle)的真实解决方案 A Lost in the Middle 需用重排序、关键信息前置与分层检索缓解 ✓ 正确答案 B 长上下文对中部信息利用完全无差 C 重排序不影响长文档问答 D 长文档无需处理
# 39. Anthropic Claude 3.5/4 的真实生产稳定性 A Claude 稳定性总体良好,但需监控波动、处理限流与多供应商兜底 ✓ 正确答案 B Claude 生产绝对稳定,无需监控 C Claude 不能用于生产 D 限流无需处理
# 40. GPT-4o 与 Claude 3.5 Sonnet 在代码生成场景的真实差异 A GPT-4o 与 Claude 3.5 代码能力完全相同 B Claude 在长上下文代码与审查上强,GPT-4o 生态均衡,需业务评测选型 ✓ 正确答案 C Claude 不能生成代码 D 选型只需看一个榜单
# 41. 闭源 API 在生产环境的真实 SLA 与故障模式 A 闭源 API 的 SLA 保证输出质量 B 闭源 API SLA 只覆盖可用性,需设计超时重试、多供应商与熔断降级 ✓ 正确答案 C 闭源 API 不会故障 D 无需监控闭源 API
# 42. Prompt tuning 与 LoRA 的真实适用边界 A Prompt tuning 与 LoRA 完全等价 B LoRA 不训练任何参数 C Prompt tuning 轻量但表达受限,LoRA 更强需数据与算力,按需选择 ✓ 正确答案 D Prompt tuning 一定优于 LoRA
# 43. 闭源 API(GPT、Claude、Gemini)的真实稳定性差异 A 三家闭源 API 稳定性完全一致 B 稳定性无需评估 C Gemini 无法使用 D 三家稳定性受任务与区域影响,生产宜多供应商路由+监控 ✓ 正确答案
# 44. RAG 的真实延迟边界(端到端 P99) A RAG P99 由检索+生成构成,用流式、缓存、路由与并行优化 ✓ 正确答案 B RAG 延迟只取决于 LLM 生成 C 延迟无法优化 D P99 不需要关注
# 45. 递归检索(Recursive Retrieval)与多跳问答(Multi-Hop QA) A 多跳问答只需一次检索 B 递归检索无成本 C 多跳问答无需推理 D 递归检索与多跳问答应对复杂查询,但需步数预算与反思防失控 ✓ 正确答案
# 46. Function Calling 的真实成功率 A Function Calling 成功率 100% B Function Calling 无法提升 C 工具描述不影响成功率 D Function Calling 成功率受工具描述与输入影响,用清晰 schema、示例与重试提升 ✓ 正确答案
# 47. Tool Use 与 Function Calling 的真实失败模式 A Tool Use 不会失败 B 工具失败无法观测 C 只有模型会失败 D Tool Use 失败模式包括参数错误、选择错误与循环,需日志诊断与重试兜底 ✓ 正确答案
# 48. 语义缓存(Semantic Cache)的真实命中率与维护 A 语义缓存命中率取决查询重复度与阈值,需防误命中并动态调阈值 ✓ 正确答案 B 语义缓存命中率与查询重复度无关 C 阈值越高越好 D 语义缓存无需维护