GPU 显存不够,模型跑不动,我学会了梯度累积这个高大上的词。我把相关的记录都翻了出来做对照。我把这个模型的推理批量化了,吞吐量提升了三倍。真香定律准时生效
😂 IT段子
程序员日常、代码趣事、技术梗图,让你在学习之余轻松一笑
这个场景用规则也许就够了,但没人愿意听。我想了想自己这些年,好像确实如此。我把这个模型的权重固化下来,先保证线上稳定。好在最后有惊无险
换了个更大的模型,效果没提升,显存占用倒是翻了三倍。我把整条链路在心里复盘了一遍。我加了个正则项,过拟合总算被压住了一点。同事说这波操作可以写进新人培训教材
这个任务的线上表现比离线差了一截。我叹了口气,然后打开了编辑器。我在心里给这个方案选了个备选模型,以防主模型不达标。我沉默了,但心里是服的
我把这个模型的输出格式约束住了,下游终于好接。我把整条链路在心里复盘了一遍。我打开了这批数据的分布,发现样本严重不均衡。我把它写进了组内的避坑文档第一章
模型的表现有一半取决于数据,另一半取决于运气。我在心里点了点头。我在心里给这个方案选了个备选模型,以防主模型不达标。同事说这波操作可以写进新人培训教材
调参一周,模型精度提升了 0.3%,领导问我能不能再提升 30%。我发现自己居然没法反驳。我打开了这批语料的来源,发现有一部分是机器翻译的。真香定律准时生效
这个方向的论文每周都在刷新,追赶是没有尽头的。我打开了这个模型的显存占用,发现激活值占了大头。真香定律准时生效
模型不会理解业务,它只会拟合你给它的样本。我抬起头看了看周围,大家都一样。我把这个模型的输出做了兜底,异常时返回默认答案。好在最后有惊无险
让 AI 写代码,它写得飞快;让我 review,我看得心慌。我盯着屏幕沉默了十分钟。我把 batch size 砍半,显存勉强够用了。真香定律准时生效