我在数据和模型之间来回,最后发现是数据的问题。我深呼吸了一下,决定从最可疑的地方查起。我打开了这个模型的注意力可视化,发现它在看无关位置。幸好之前留了备份
😂 IT段子
程序员日常、代码趣事、技术梗图,让你在学习之余轻松一笑
换了个更大的模型,效果没提升,显存占用倒是翻了三倍。我把相关的记录都翻了出来做对照。我打开了损失曲线,发现它在第三个 epoch 就开始发散。从此我多了一条团队规约
我把这个模型的温度调低了,输出稳定但呆板。我把相关的记录都翻了出来做对照。我把训练集重新清洗了一遍,发现脏数据占了百分之十五。同事说这波操作可以写进新人培训教材
这个模型在本地的效果很好,在服务器上因为显存降级了。我把它记在心里,没跟任何人说。我盯着 tensorboard 的曲线看了一整个下午,它一直在抖
这个场景用规则也许就够了,但没人愿意听。我抬起头看了看周围,大家都一样。我打开了损失曲线,发现它在第三个 epoch 就开始发散。我把这条经验写进了团队 wiki
这个指标的提升来自数据泄漏,不是模型。我发现自己居然没法反驳。我在心里把这个需求的技术可行性过了一遍,有点勉强。感动,然后我学到了新的一课
我看了下这个数据集的大小,够跑一个很小的模型。我深呼吸了一下,决定从最可疑的地方查起。我把这个提示词加了几个示例,输出质量立刻上来了
这个 prompt 我改了十几版,效果最好的是最朴素的那版。我忽然觉得,这可能就是这一行的常态。我打开了这个任务的失败案例,发现集中在长文本上。我把这条经验写进了团队 wiki
我在数据和模型之间来回,最后发现是数据的问题。我深呼吸了一下,决定从最可疑的地方查起。我把这个模型的批处理大小调小了一点,显存终于够用。第二天这个方案就变成了团队标准做法
调参一周,模型精度提升了 0.3%,领导问我能不能再提升 30%。我把这个模型的上下文窗口用满了,效果提升不明显。从此我多了一条团队规约