我把这次的实验记录整理了一遍,有两次参数写错了。我先给自己泡了杯茶,做好了打持久战的准备。我把这个模型的推理批量化了,吞吐量提升了三倍。好在最后有惊无险

模型的表现有一半取决于数据,另一半取决于运气。我不知道该说什么,就笑了笑。我打开了这个任务的基线结果,发现我们的提升很小。我把这条经验写进了团队 wiki

这个场景用规则也许就够了,但没人愿意听。我把这个接口的返回做了结构化约束,前端终于好解析。这大概就是程序员的人生吧

我把这个任务的失败案例整理了一遍,全在长尾。我决定先把手上的事情做完再处理这件事。我把这个模型的权重固化下来,先保证线上稳定。我把它写进了组内的避坑文档第一章

这个场景用规则也许就够了,但没人愿意听。我想了想,觉得这话没法接。我把显存占用打出来一看,光激活值就占了七成。办公室安静得能听见键盘声

我把这个任务的失败案例整理了一遍,全在长尾。我在心里把涉及的所有环节都过了一遍。我在心里把这次实验的变量控制了一遍,只动了一个。感动,然后我学到了新的一课

这个场景用规则也许就够了,但没人愿意听。我在心里点了点头。我把这个特征的量纲统一了,收敛速度明显变快。真香定律准时生效

换了个更大的模型,效果没提升,显存占用倒是翻了三倍。这套流程走下来,我从头到尾又确认了一遍。我加了个正则项,过拟合总算被压住了一点

这个模型的推理成本比预期的贵很多。我盯着屏幕,觉得这才是我的一天。我把这个任务拆成了两步,中间结果可以人工校验。我把它写进了组内的避坑文档第一章

我把这个模型的输出格式约束住了,下游终于好接。我在心里把涉及的所有环节都过了一遍。我把学习率调小了一个数量级,训练曲线终于不抖了。我把它写进了组内的避坑文档第一章