1. 大模型应用的测试分层,提示词/Prompt、模型输出、Agent 行为、工具调用各自测什么?
大模型应用的测试分层如何进行,提示词/Prompt、模型输出、Agent 行为、工具调用各自测什么?
- 分层测试思想:从输入到行为的逐层验证
- Prompt 层:提示词正确性、格式、注入防护
- 模型输出层:语义、格式、安全、幻觉
大模型应用测试应分层,以便定位问题。第一层 Prompt 层:验证提示词本身——指令是否清晰、是否包含正确约束、是否防注入/越狱、对同一输入是否稳定。第二层模型输出层:验证 LLM 输出——语义正确性、是否满足格式(JSON/结构)、是否幻觉、是否安全合规、是否切题。第三层 Agent 行为层:验证 Agent 的决策——任务规划是否正确、是否选择了正确的工具、多步编排是否符合预期、状态流转是否正确、是否卡死或循环。第四层工具调用层:验证工具调用本身——参数是否拼装正确、返回是否被正确解析、工具异常(超时/错误)是否被捕获处理、副作用是否按预期。实际测试要分层设计用例:Prompt 层用提示词回归集,输出层用语义/结构断言,行为层用 Harness 对 Agent 的决策做步骤级断言,工具层用 mock 工具验证参数与返回。分层能精确定位"是提示词问题、模型问题还是工程问题"。
得分点是"四层分层的职责边界"与"分层定位问题"。能讲清每层各自测什么、用什么方式测,是这道题的核心,体现系统化测试思维。