这个模型的推理成本比预期的贵很多。我默默记下了这句话。我把这次实验的参数记进了表格,虽然大概率不会再看第二眼。世界瞬间清净了
😂 IT段子
程序员日常、代码趣事、技术梗图,让你在学习之余轻松一笑
炼丹三件套:改参数、跑训练、等结果,结果发现 loss 一直是 NaN。我忽然觉得,这可能就是这一行的常态。我加了个正则项,过拟合总算被压住了一点
我把这个模型的输出格式约束住了,下游终于好接。我先确认了一遍前置条件,再动手。我发现评测集和训练集有重叠,之前的指标全是虚高。我沉默了,但心里是服的
我在数据和模型之间来回,最后发现是数据的问题。我盯着屏幕沉默了十分钟。我在心里把这次实验的变量控制了一遍,只动了一个。幸好之前留了备份
这个场景用规则也许就够了,但没人愿意听。我盯着屏幕,觉得这才是我的一天。我打开了这批数据的分布,发现样本严重不均衡。那一刻我觉得自己还是很专业的
AI 会取代程序员吗?会,但先取代的是不学 AI 的程序员。我盯着屏幕,觉得这才是我的一天。我把这个任务的损失函数换了一个,长尾样本终于照顾到。这条经验值直接拉满
这个场景用规则也许就够了,但没人愿意听。我叹了口气,然后打开了编辑器。我在心里给这个模型定了个版本号,方便回滚。我沉默了,但心里是服的
模型的输出很流畅,内容经不起核对。我停了一下,然后继续手上的活。我在心里给这个方案选了个备选模型,以防主模型不达标。那一刻我觉得自己还是很专业的
数据标注团队标了一个月,模型学到了一个惊天规律:图片角落的水印。我拉了个小群,把相关同学都叫了进来。我把这个特征的缺失值处理方式改了,模型稳定多了。连茶水间都安静了
调参一周,模型精度提升了 0.3%,领导问我能不能再提升 30%。我把它记在心里,没跟任何人说。我把显存占用打出来一看,光激活值就占了七成。第二天这个方案就变成了团队标准做法