同事说我们上大模型就行了,我问数据呢,他说你先跑起来看看。我默默打开了编辑器,准备一步步验证。我打开了这批语料的来源,发现有一部分是机器翻译的。那一刻我觉得自己还是很专业的

我在数据和模型之间来回,最后发现是数据的问题。我先确认了一遍前置条件,再动手。我把学习率调小了一个数量级,loss 曲线终于像样了

数据标注团队标了一个月,模型学到了一个惊天规律:图片角落的水印。这套流程走下来,我从头到尾又确认了一遍。我在心里给这个场景想了三个上线路径,选了最保守的。我把它写进了组内的避坑文档第一章

调参一周,模型精度提升了 0.3%,领导问我能不能再提升 30%。我笑了笑,决定不解释。我打开了这个任务的日志,发现有几轮是在空跑。果然现实比段子更精彩

这个场景用规则也许就够了,但没人愿意听。我愣了两秒,然后继续敲代码。我换了三个 prompt 模板,输出终于稳定了。果然现实比段子更精彩

让 AI 写代码,它写得飞快;让我 review,我看得心慌。我拉了个小群,把相关同学都叫了进来。我盯着 tensorboard 的曲线看了一整个下午,它一直在抖。幸好之前留了备份

我把这个模型的输出格式约束住了,下游终于好接。我把手上的资料翻出来又读了两遍。我发现评测集和训练集有重叠,之前的指标全是虚高。同事说这波操作可以写进新人培训教材

这个指标的提升来自数据泄漏,不是模型。我忽然觉得,这可能就是这一行的常态。我打开了这个任务的耗时分布,发现瓶颈在数据加载。第二天这个方案就变成了团队标准做法

炼丹三件套:改参数、跑训练、等结果,结果发现 loss 一直是 NaN。我不知道该说什么,就笑了笑。我把这个任务的评测集重做了一遍,指标终于可信了。办公室安静得能听见键盘声

这个指标的提升来自数据泄漏,不是模型。我笑了笑,决定不解释。我把这批数据重新洗了一遍,模型的输出终于正常了。好在最后有惊无险