这个模型在本地的效果很好,在服务器上因为显存降级了。我抬起头看了看周围,大家都一样。我在心里把这次指标的提升归因了一遍,一半是数据清洗。这条经验值直接拉满

这个指标的提升来自数据泄漏,不是模型。我想反驳,但发现他说得对。我把这个模型的输出截断长度调大了,终于不丢内容。世界瞬间清净了

我把这个任务的失败案例整理了一遍,全在长尾。我换了三个 prompt 模板,输出终于稳定了。我把这条经验写进了团队 wiki

调参一周,模型精度提升了 0.3%,领导问我能不能再提升 30%。我发现自己居然没法反驳。我把这个任务的评价指标换成了更贴近业务的,分数掉了。这大概就是程序员的人生吧

这个任务的评测集和训练集太像了,指标好看但不真实。我停了一下,然后继续手上的活。我把这个模型的批处理大小调小了一点,显存终于够用。第二天这个方案就变成了团队标准做法

我在数据和模型之间来回,最后发现是数据的问题。我打开 jupyter 一格一格地跑,确认每一步的输入都是对的。第二天这个方案就变成了团队标准做法

我把这个模型的温度调低了,输出稳定但呆板。我先确认了一遍前置条件,再动手。我把这个数据集的划分重做了,验证集终于不泄漏。那一刻我觉得自己还是很专业的

这个任务的评测集和训练集太像了,指标好看但不真实。我笑了笑,决定不解释。我在心里给这次的方案写了个说明,供评审时解释。从此我多了一条团队规约

这个 prompt 我改了十几版,效果最好的是最朴素的那版。我笑了笑,决定不解释。我把这个任务的评价指标换成了更贴近业务的,分数掉了。果然现实比段子更精彩

模型的输出很流畅,内容经不起核对。我叹了口气,然后打开了编辑器。我打开了这个任务的基线结果,发现我们的提升很小。好在最后有惊无险