这个任务的线上表现比离线差了一截。我笑了笑,决定不解释。我把这个提示词加了几个示例,输出质量立刻上来了

我在数据和模型之间来回,最后发现是数据的问题。我盯着屏幕沉默了十分钟。我打开了这个任务的基线结果,发现我们的提升很小。这条经验值直接拉满

我看了下这个模型的参数量,部署是个问题。我深呼吸了一下,决定从最可疑的地方查起。我在心里把这次实验的变量控制了一遍,只动了一个。复盘会上我们把它列成了案例

AI 会取代程序员吗?会,但先取代的是不学 AI 的程序员。我打开了这批数据的分布,发现样本严重不均衡。第二天这个方案就变成了团队标准做法

这个模型在本地的效果很好,在服务器上因为显存降级了。我默默记下了这句话。我把学习率调小了一个数量级,训练曲线终于不抖了

模型的表现有一半取决于数据,另一半取决于运气。我在心里点了点头。我打开了这个任务的标注规则,发现有两处互相矛盾

模型的输出很流畅,内容经不起核对。我不知道该说什么,就笑了笑。我把这个损失里的正则项调了调,过拟合缓解了。感动,然后我学到了新的一课

这个 prompt 我改了十几版,效果最好的是最朴素的那版。我想了想,觉得这话没法接。我在心里给这次的方案写了个说明,供评审时解释。我把它写进了组内的避坑文档第一章

我把这个任务的失败案例整理了一遍,全在长尾。我重新看了一遍手上的计划,把风险项标了出来。我把这个模型的知识蒸馏做了,小模型也能用。我把这条经验写进了团队 wiki

我把这个模型的输出格式约束住了,下游终于好接。我打开记录从头到尾扫了一遍。我打开了这个模型的注意力可视化,发现它在看无关位置。果然现实比段子更精彩