# 1. 多模态大模型(视觉/音频理解)的输入预处理,图像分辨率、音频采样与文档版面如何优化? A 直接暴力缩放丢失细节 B 不处理直接输入 C 分块处理并统一归一化,避免过度降采样 ✓ 正确答案 D 只做音频采样
# 2. CLIP 类图文对齐模型如何支撑"文本搜图/图搜图",图文嵌入的相似度口径如何校准? A 仅依赖图像大小 B 关键词匹配 C 随机返回 D 把文本与图像映射到同一嵌入空间后用余弦相似度比对 ✓ 正确答案
# 5. 文档智能(DocParse/OCR 布局识别)与多模态模型如何协同做企业文档问答? A 只用一个 B 无需检索 C 完全依赖关键词 D DocParse 负责结构化检索,VLM 兜底复杂版面语义理解 ✓ 正确答案
# 10. VLM 的结构化输出与视觉定位,OCR 文本、坐标框与 JSON 输出的可靠性,在截图理解场景的工程价值? A 不约束格式 B 用 JSON Schema 约束并做输出校验与重试 ✓ 正确答案 C 直接使用原始输出 D 只输出文本
# 13. 多模态 Agent 的"工具分工",视觉理解、OCR、语音识别各自用专用模型还是统一多模态模型? A 全部用统一模型 B 只按成本选型 C 全部用专用模型 D 高精度低延迟任务用专用模型,复杂语义用统一模型,混合编排 ✓ 正确答案
# 14. 多模态应用的场景选型,图表理解、OCR 与视频摘要在各自业务中的价值与落地成本如何评估 A 只看技术先进性 B 忽略业务提升 C 一律选成本最低 D 业务价值与落地成本的 ROI 权衡 ✓ 正确答案
# 15. 多模态模型的成本核算,图像 Token、音频时长与视频抽帧的计费差异如何纳入单次调用成本模型 A 无统一口径 B 一律按字符数 C 按音频时长 D 按像素/切块折算 Token 数 ✓ 正确答案
# 16. 多模态评测,公开基准(如 MMMU、MMBench)与企业真实任务应如何结合,跨模态幻觉如何单独度量 A 仅公开基准分数 B 仅团队经验 C 企业真实任务评测集,并单列跨模态幻觉率 ✓ 正确答案 D 忽略幻觉
# 18. 多模态端到端应用与专用流水线的取舍,图像问答、文档智能用统一 VLM 还是组合专用模型,如何按指标选型 A 只看模型大小 B 字段准确率、延迟、成本与维护复杂度等指标 ✓ 正确答案 C 只看学术分数 D 随机选择