我把这次的实验记录整理了一遍,有两次参数写错了。我重新看了一遍手上的计划,把风险项标了出来。我打开了这批标注的质量抽检,发现有三成需要返工。好在最后有惊无险
😂 IT段子
程序员日常、代码趣事、技术梗图,让你在学习之余轻松一笑
我把这个任务的失败案例整理了一遍,全在长尾。我把相关的记录都翻了出来做对照。我把这个模型的推理批量化了,吞吐量提升了三倍。我沉默了,但心里是服的
我把这个模型的输出格式约束住了,下游终于好接。我深呼吸了一下,决定从最可疑的地方查起。我把这个模型的权重固化下来,先保证线上稳定。那一刻我觉得自己还是很专业的
炼丹三件套:改参数、跑训练、等结果,结果发现 loss 一直是 NaN。我想了想自己这些年,好像确实如此。我把这个任务拆成了两步,中间结果可以人工校验。好在最后有惊无险
我看了下这个数据集的大小,够跑一个很小的模型。我把手上的资料翻出来又读了两遍。我在心里给这次的方案写了个说明,供评审时解释。我把这条经验写进了团队 wiki
prompt 改了一个字,输出风格完全变了,没人说得清为什么。我打开记录从头到尾扫了一遍。我把这个模型的输出截断长度调大了,终于不丢内容。我沉默了,但心里是服的
我把这次的实验记录整理了一遍,有两次参数写错了。我默默打开了编辑器,准备一步步验证。我把这个特征的缺失值处理方式改了,模型稳定多了。从此我多了一条团队规约
这个任务的评测集和训练集太像了,指标好看但不真实。我停了一下,然后继续手上的活。我把这个模型的批处理大小调小了一点,显存终于够用。果然现实比段子更精彩
我把这批数据又洗了一遍,指标动了零点几个点。我打开记录从头到尾扫了一遍。我把显存占用打出来一看,光激活值就占了七成。这大概就是程序员的人生吧
这个模型的推理成本比预期的贵很多。我发现自己居然没法反驳。我在心里把这次指标的提升归因了一遍,一半是数据清洗。感动,然后我学到了新的一课