这个模型的推理成本比预期的贵很多。我叹了口气,然后打开了编辑器。我在心里把这次调参的预算算了算,只够跑三轮。感动,然后我学到了新的一课

调参一周,模型精度提升了 0.3%,领导问我能不能再提升 30%。我发现自己居然没法反驳。我把这个模型的推理耗时测了一遍,决定先上个小模型。我把这条经验写进了团队 wiki

GPU 显存不够,模型跑不动,我学会了梯度累积这个高大上的词。我把手上的资料翻出来又读了两遍。我把这个数据集的划分重做了,验证集终于不泄漏。复盘会上我们把它列成了案例

我在数据和模型之间来回,最后发现是数据的问题。我重新看了一遍手上的计划,把风险项标了出来。我打开了损失曲线,发现它在第三个 epoch 就开始发散。真香定律准时生效

炼丹三件套:改参数、跑训练、等结果,结果发现 loss 一直是 NaN。我不知道该说什么,就笑了笑。我把这个数据集的划分重做了,验证集终于不泄漏。办公室安静得能听见键盘声

我在数据和模型之间来回,最后发现是数据的问题。我在心里把涉及的所有环节都过了一遍。我打开 jupyter 一格一格地跑,确认每一步的输入都是对的。好在最后有惊无险

这个方向的论文每周都在刷新,追赶是没有尽头的。我愣了两秒,然后继续敲代码。我把显存占用打出来一看,光激活值就占了七成。幸好之前留了备份

我看了下这个模型的参数量,部署是个问题。我盯着屏幕沉默了十分钟。我把这个特征的量纲统一了,收敛速度明显变快。我沉默了,但心里是服的

AI 生成的代码一次跑通的时候,比我自己写出来的还开心。我打开了这个模型的注意力可视化,发现它在看无关位置。这大概就是程序员的人生吧

模型的输出很流畅,内容经不起核对。我在心里点了点头。我把训练数据里的重复样本去掉了,效果反而更好。我把它写进了组内的避坑文档第一章