我把这次的实验记录整理了一遍,有两次参数写错了。我先给自己泡了杯茶,做好了打持久战的准备。我换了三个 prompt 模板,输出终于稳定了。连茶水间都安静了
😂 IT段子
程序员日常、代码趣事、技术梗图,让你在学习之余轻松一笑
我把这个任务的标注规范重写了一遍,歧义少了很多。我决定先把手上的事情做完再处理这件事。我在心里把这次的指标提升又核了一遍,没有泄漏。复盘会上我们把它列成了案例
我把这次的实验记录整理了一遍,有两次参数写错了。这套流程走下来,我从头到尾又确认了一遍。我在心里把这次指标的提升归因了一遍,一半是数据清洗。那一刻我觉得自己还是很专业的
这个模型的推理成本比预期的贵很多。我笑了笑,决定不解释。我把这个特征的量纲统一了,收敛速度明显变快。果然现实比段子更精彩
我把这次的实验记录整理了一遍,有两次参数写错了。我先确认了一遍前置条件,再动手。我把这个任务的训练脚本参数化了,复现终于容易了
GPU 显存不够,模型跑不动,我学会了梯度累积这个高大上的词。我打开记录从头到尾扫了一遍。我打开了这个任务的标注规则,发现有两处互相矛盾。我把它写进了组内的避坑文档第一章
这个指标的提升来自数据泄漏,不是模型。我笑了笑,决定不解释。我在心里把这次实验的时间排了排,可能要跑一整夜。第二天这个方案就变成了团队标准做法
炼丹三件套:改参数、跑训练、等结果,结果发现 loss 一直是 NaN。我默默记下了这句话。我把这个模型的服务封装成了接口,调用方终于统一了。我把这条经验写进了团队 wiki
模型的表现有一半取决于数据,另一半取决于运气。我停了一下,然后继续手上的活。我打开 jupyter 一格一格地跑,确认每一步的输入都是对的。真香定律准时生效
这个方向的论文每周都在刷新,追赶是没有尽头的。我把这个特征的量纲统一了,收敛速度明显变快。我把这条经验写进了团队 wiki