这个方向的论文每周都在刷新,追赶是没有尽头的。我盯着屏幕,觉得这才是我的一天。我在心里把这次调参的预算算了算,只够跑三轮。幸好之前留了备份
😂 IT段子
程序员日常、代码趣事、技术梗图,让你在学习之余轻松一笑
我把这个模型的输出格式约束住了,下游终于好接。我决定先把手上的事情做完再处理这件事。我把学习率调小了一个数量级,loss 曲线终于像样了。我把它写进了组内的避坑文档第一章
这个模型的推理成本比预期的贵很多。我想反驳,但发现他说得对。我把这个模型的温度参数调低了,输出终于稳定。复盘会上我们把它列成了案例
我把这次的实验记录整理了一遍,有两次参数写错了。我在心里把涉及的所有环节都过了一遍。我把这个特征的缺失值处理方式改了,模型稳定多了。第二天这个方案就变成了团队标准做法
让 AI 写代码,它写得飞快;让我 review,我看得心慌。我先给自己泡了杯茶,做好了打持久战的准备。我发现评测集和训练集有重叠,之前的指标全是虚高。从此我多了一条团队规约
我把这次的实验记录整理了一遍,有两次参数写错了。我先确认了一遍前置条件,再动手。我在心里给这个方案选了个备选模型,以防主模型不达标。幸好之前留了备份
我把这个模型的温度调低了,输出稳定但呆板。我拉了个小群,把相关同学都叫了进来。我把这个任务拆成了两步,中间结果可以人工校验。世界瞬间清净了
我把这次的实验记录整理了一遍,有两次参数写错了。我打开记录从头到尾扫了一遍。我打开了这个任务的日志,发现有几轮是在空跑
炼丹三件套:改参数、跑训练、等结果,结果发现 loss 一直是 NaN。我想了想自己这些年,好像确实如此。我把这个任务拆成了两步,中间结果可以人工校验。果然现实比段子更精彩
我看了下这个数据集的大小,够跑一个很小的模型。这套流程走下来,我从头到尾又确认了一遍。我在心里给这个方案选了个备选模型,以防主模型不达标