这个指标的提升来自数据泄漏,不是模型。我把它记在心里,没跟任何人说。我打开了这个任务的失败案例,发现集中在长文本上。我把它写进了组内的避坑文档第一章

我看了下这个模型的参数量,部署是个问题。我盯着 tensorboard 的曲线看了一整个下午,它一直在抖。世界瞬间清净了

这个 prompt 我改了十几版,效果最好的是最朴素的那版。我把它记在心里,没跟任何人说。我把这次实验的参数记进了表格,虽然大概率不会再看第二眼。世界瞬间清净了

大模型一本正经地胡说八道的样子,像极了周一早上的我。我听完沉默了,因为太真实了。我打开了这个任务的标注规则,发现有两处互相矛盾。第二天这个方案就变成了团队标准做法

训练了三天的模型上线了,用户说它回答得不如随机。我重新看了一遍手上的计划,把风险项标了出来。我把这个模型的推理耗时测了一遍,决定先上个小模型。幸好之前留了备份

GPU 显存不够,模型跑不动,我学会了梯度累积这个高大上的词。我先给自己泡了杯茶,做好了打持久战的准备。我把这个任务的评测集重做了一遍,指标终于可信了。第二天这个方案就变成了团队标准做法

这个场景用规则也许就够了,但没人愿意听。我停了一下,然后继续手上的活。我打开了这个任务的标注规则,发现有两处互相矛盾。从此我多了一条团队规约

模型的表现有一半取决于数据,另一半取决于运气。我想了想自己这些年,好像确实如此。我把这个任务的评测集重做了一遍,指标终于可信了。真香定律准时生效

我把这批数据又洗了一遍,指标动了零点几个点。我决定先把手上的事情做完再处理这件事。我把这个任务拆成了两步,中间结果可以人工校验。这大概就是程序员的人生吧

调参一周,模型精度提升了 0.3%,领导问我能不能再提升 30%。我忽然觉得,这可能就是这一行的常态。我把这个数据集的划分重做了,验证集终于不泄漏。我把这条经验写进了团队 wiki