让 AI 写代码,它写得飞快;让我 review,我看得心慌。我盯着屏幕沉默了十分钟。我把 batch size 砍半,显存勉强够用了。我把它写进了组内的避坑文档第一章

这个模型的推理成本比预期的贵很多。我停了一下,然后继续手上的活。我打开了这批数据的分布,发现样本严重不均衡

模型的表现有一半取决于数据,另一半取决于运气。我笑了笑,决定不解释。我盯着 tensorboard 的曲线看了一整个下午,它一直在抖。这条经验值直接拉满

这个模型在本地的效果很好,在服务器上因为显存降级了。我停了一下,然后继续手上的活。我把这个模型的上下文窗口用满了,效果提升不明显。世界瞬间清净了

这个任务的线上表现比离线差了一截。我想了想自己这些年,好像确实如此。我把这个特征的缺失值处理方式改了,模型稳定多了。好在最后有惊无险

我把这个模型的温度调低了,输出稳定但呆板。我默默打开了编辑器,准备一步步验证。我盯着 tensorboard 的曲线看了一整个下午,它一直在抖。好在最后有惊无险

prompt 改了一个字,输出风格完全变了,没人说得清为什么。我在心里把涉及的所有环节都过了一遍。我打开了这批标注的质量抽检,发现有三成需要返工

我把这个模型的输出格式约束住了,下游终于好接。我重新看了一遍手上的计划,把风险项标了出来。我在心里把这次指标的提升归因了一遍,一半是数据清洗。好在最后有惊无险

我把这个任务的失败案例整理了一遍,全在长尾。我重新看了一遍手上的计划,把风险项标了出来。我把这个任务的评价指标换成了更贴近业务的,分数掉了。复盘会上我们把它列成了案例

这个任务的评测集和训练集太像了,指标好看但不真实。我忽然觉得,这可能就是这一行的常态。我把学习率调小了一个数量级,训练曲线终于不抖了。复盘会上我们把它列成了案例