1. Agent 在生产环境的成功率基线,SWE-bench Verified、WebArena、OSWorld 等基准的数字会随模型代际快速变化,为何不能直接外推为生产成功率,如何理解这些基准与 Demo 表现的差距?
Agent 生产环境的成功率基线如何设定?SWE-bench Verified、WebArena、OSWorld 等基准的数字会随模型代际快速变化,为何不能直接外推为生产成功率?如何理解这些基准与 Demo 表现的差距?
- 基准的适用范围与局限
- 基准到生产的外推差异
- 生产基线的建立方法
这些基准(SWE-bench、WebArena、OSWorld)在固定数据集上衡量 Agent 的端到端任务完成率,是追踪模型能力的有效标尺,但数字不能直接当作生产成功率。原因:基准任务是静态、封闭、有确定答案的,而生产环境是动态、开放、噪声大、权限/工具异构的;基准的"环境"与生产系统(数据库、工具、权限、网络)差异巨大;基准流行度高、被优化甚至过拟合,数字会随代际快速上涨,不代表企业对真实业务同样有效;Demo 常选取最有利案例、人工辅助、不计失败,故表现远高于真实。因此应把基准作为"相对能力趋势"参照,建立企业自有评测集(真实业务轨迹 + 灰度抽样),用真实线上成功率、失败率与回滚率作为生产基线,并持续跟踪。
基准与生产之间隔着"环境差异、任务分布差异、过拟合膨胀"三重鸿沟。正确做法是"基准看趋势、自有集看真实",把基准分数用于跟踪模型代际与选型,把线上真实指标用于生产基线,两者互补而非互相替代。