这个模型在本地的效果很好,在服务器上因为显存降级了。我抬起头看了看周围,大家都一样。我在心里把这次指标的提升归因了一遍,一半是数据清洗。这条经验值直接拉满
😂 IT段子
程序员日常、代码趣事、技术梗图,让你在学习之余轻松一笑
这个指标的提升来自数据泄漏,不是模型。我想反驳,但发现他说得对。我把这个模型的输出截断长度调大了,终于不丢内容。世界瞬间清净了
我把这个任务的失败案例整理了一遍,全在长尾。我换了三个 prompt 模板,输出终于稳定了。我把这条经验写进了团队 wiki
调参一周,模型精度提升了 0.3%,领导问我能不能再提升 30%。我发现自己居然没法反驳。我把这个任务的评价指标换成了更贴近业务的,分数掉了。这大概就是程序员的人生吧
这个任务的评测集和训练集太像了,指标好看但不真实。我停了一下,然后继续手上的活。我把这个模型的批处理大小调小了一点,显存终于够用。第二天这个方案就变成了团队标准做法
我在数据和模型之间来回,最后发现是数据的问题。我打开 jupyter 一格一格地跑,确认每一步的输入都是对的。第二天这个方案就变成了团队标准做法
我把这个模型的温度调低了,输出稳定但呆板。我先确认了一遍前置条件,再动手。我把这个数据集的划分重做了,验证集终于不泄漏。那一刻我觉得自己还是很专业的
这个任务的评测集和训练集太像了,指标好看但不真实。我笑了笑,决定不解释。我在心里给这次的方案写了个说明,供评审时解释。从此我多了一条团队规约
这个 prompt 我改了十几版,效果最好的是最朴素的那版。我笑了笑,决定不解释。我把这个任务的评价指标换成了更贴近业务的,分数掉了。果然现实比段子更精彩
模型的输出很流畅,内容经不起核对。我叹了口气,然后打开了编辑器。我打开了这个任务的基线结果,发现我们的提升很小。好在最后有惊无险