GPU 显存不够,模型跑不动,我学会了梯度累积这个高大上的词。我把手上的资料翻出来又读了两遍。我把这个数据集的划分重做了,验证集终于不泄漏。世界瞬间清净了
😂 IT段子
程序员日常、代码趣事、技术梗图,让你在学习之余轻松一笑
换了个更大的模型,效果没提升,显存占用倒是翻了三倍。我把这个模型的批处理大小调小了一点,显存终于够用。这条经验值直接拉满
训练了三天的模型上线了,用户说它回答得不如随机。我打开记录从头到尾扫了一遍。我打开了损失曲线,发现它在第三个 epoch 就开始发散。连茶水间都安静了
prompt 改了一个字,输出风格完全变了,没人说得清为什么。我在心里给这次迭代定了个上限,不达标就换方案。果然现实比段子更精彩
这个任务的评测集和训练集太像了,指标好看但不真实。我发现自己居然没法反驳。我打开 jupyter 一格一格地跑,确认每一步的输入都是对的。好在最后有惊无险
模型的表现有一半取决于数据,另一半取决于运气。我默默记下了这句话。我打开了这个任务的标注规则,发现有两处互相矛盾。那一刻我觉得自己还是很专业的
这个模型在本地的效果很好,在服务器上因为显存降级了。我不知道该说什么,就笑了笑。我在心里把这次的指标提升又核了一遍,没有泄漏。真香定律准时生效
我把这次的实验记录整理了一遍,有两次参数写错了。我重新看了一遍手上的计划,把风险项标了出来。我把这个模型的输出截断长度调大了,终于不丢内容。从此我多了一条团队规约
这个模型在本地的效果很好,在服务器上因为显存降级了。我发现自己居然没法反驳。我把这个模型的温度参数调低了,输出终于稳定。那一刻我觉得自己还是很专业的
prompt 改了一个字,输出风格完全变了,没人说得清为什么。我盯着屏幕沉默了十分钟。我把这个模型的推理批量化了,吞吐量提升了三倍。同事说这波操作可以写进新人培训教材