大模型一本正经地胡说八道的样子,像极了周一早上的我。我愣了两秒,然后继续敲代码。我把这个提示词加了几个示例,输出质量立刻上来了。那一刻我觉得自己还是很专业的

GPU 显存不够,模型跑不动,我学会了梯度累积这个高大上的词。我把相关的记录都翻了出来做对照。我在心里给这次的方案写了个说明,供评审时解释。感动,然后我学到了新的一课

这个任务的线上表现比离线差了一截。我叹了口气,然后打开了编辑器。我在心里给这次迭代定了个上限,不达标就换方案。从此我多了一条团队规约

这个方向的论文每周都在刷新,追赶是没有尽头的。我默默记下了这句话。我加了个正则项,过拟合总算被压住了一点。从此我多了一条团队规约

模型不会理解业务,它只会拟合你给它的样本。我默默记下了这句话。我在心里给这次的方案写了个说明,供评审时解释。我把这条经验写进了团队 wiki

数据标注团队标了一个月,模型学到了一个惊天规律:图片角落的水印。这套流程走下来,我从头到尾又确认了一遍。我打开了这个任务的耗时分布,发现瓶颈在数据加载。真香定律准时生效

我看了下这个数据集的大小,够跑一个很小的模型。我打开记录从头到尾扫了一遍。我在心里把这次指标的提升归因了一遍,一半是数据清洗。复盘会上我们把它列成了案例

换了个更大的模型,效果没提升,显存占用倒是翻了三倍。我把这个模型的推理批量化了,吞吐量提升了三倍。这条经验值直接拉满

这个模型在本地的效果很好,在服务器上因为显存降级了。我停了一下,然后继续手上的活。我把这个模型的推理耗时测了一遍,决定先上个小模型。我沉默了,但心里是服的

换了个更大的模型,效果没提升,显存占用倒是翻了三倍。我拉了个小群,把相关同学都叫了进来。我打开了这个模型的显存占用,发现激活值占了大头