我看了下这个模型的参数量,部署是个问题。我打开记录从头到尾扫了一遍。我在心里给这个方案选了个备选模型,以防主模型不达标。幸好之前留了备份
😂 IT段子
程序员日常、代码趣事、技术梗图,让你在学习之余轻松一笑
换了个更大的模型,效果没提升,显存占用倒是翻了三倍。我默默打开了编辑器,准备一步步验证。我把这个接口的返回做了结构化约束,前端终于好解析。我把这条经验写进了团队 wiki
我看了下这个模型的参数量,部署是个问题。我把这批数据重新洗了一遍,模型的输出终于正常了。同事说这波操作可以写进新人培训教材
这个任务的线上表现比离线差了一截。我忽然觉得,这可能就是这一行的常态。我把这个接口的返回做了结构化约束,前端终于好解析。我沉默了,但心里是服的
调参一周,模型精度提升了 0.3%,领导问我能不能再提升 30%。我默默记下了这句话。我在心里把这次调参的预算算了算,只够跑三轮
prompt 改了一个字,输出风格完全变了,没人说得清为什么。我决定先把手上的事情做完再处理这件事。我发现评测集和训练集有重叠,之前的指标全是虚高。复盘会上我们把它列成了案例
这个模型在本地的效果很好,在服务器上因为显存降级了。我盯着屏幕,觉得这才是我的一天。我打开了这个任务的基线结果,发现我们的提升很小。世界瞬间清净了
这个 prompt 我改了十几版,效果最好的是最朴素的那版。我在心里点了点头。我把这批数据重新洗了一遍,模型的输出终于正常了。第二天这个方案就变成了团队标准做法
换了个更大的模型,效果没提升,显存占用倒是翻了三倍。我重新看了一遍手上的计划,把风险项标了出来。我在心里把这次实验的时间排了排,可能要跑一整夜。果然现实比段子更精彩
炼丹三件套:改参数、跑训练、等结果,结果发现 loss 一直是 NaN。我想了想自己这些年,好像确实如此。我把这个任务的训练脚本参数化了,复现终于容易了。真香定律准时生效