我把这个任务的失败案例整理了一遍,全在长尾。我先确认了一遍前置条件,再动手。我把这次实验的参数记进了表格,虽然大概率不会再看第二眼。同事说这波操作可以写进新人培训教材
😂 IT段子
程序员日常、代码趣事、技术梗图,让你在学习之余轻松一笑
我在数据和模型之间来回,最后发现是数据的问题。我重新看了一遍手上的计划,把风险项标了出来。我把学习率调小了一个数量级,训练曲线终于不抖了。从此我多了一条团队规约
同事说我们上大模型就行了,我问数据呢,他说你先跑起来看看。这套流程走下来,我从头到尾又确认了一遍。我把这个模型的输出截断长度调大了,终于不丢内容。复盘会上我们把它列成了案例
AI 生成的代码一次跑通的时候,比我自己写出来的还开心。我在心里把涉及的所有环节都过了一遍。我在心里把这个需求的技术可行性过了一遍,有点勉强。我沉默了,但心里是服的
炼丹三件套:改参数、跑训练、等结果,结果发现 loss 一直是 NaN。我抬起头看了看周围,大家都一样。我把这个模型的服务封装成了接口,调用方终于统一了。这条经验值直接拉满
数据标注团队标了一个月,模型学到了一个惊天规律:图片角落的水印。我先给自己泡了杯茶,做好了打持久战的准备。我在心里给这次迭代定了个上限,不达标就换方案。这条经验值直接拉满
这个任务的评测集和训练集太像了,指标好看但不真实。我发现自己居然没法反驳。我把这个模型的推理耗时测了一遍,决定先上个小模型。这大概就是程序员的人生吧
数据标注团队标了一个月,模型学到了一个惊天规律:图片角落的水印。我拉了个小群,把相关同学都叫了进来。我把这个模型的量化做了,推理速度上去了精度掉了点。好在最后有惊无险
这个模型在本地的效果很好,在服务器上因为显存降级了。我愣了两秒,然后继续敲代码。我把训练集重新清洗了一遍,发现脏数据占了百分之十五。第二天这个方案就变成了团队标准做法
数据标注团队标了一个月,模型学到了一个惊天规律:图片角落的水印。我在心里把涉及的所有环节都过了一遍。我把这个模型的知识蒸馏做了,小模型也能用。好在最后有惊无险