我把这个任务的标注规范重写了一遍,歧义少了很多。我把相关的记录都翻了出来做对照。我在心里把这次指标的提升归因了一遍,一半是数据清洗。第二天这个方案就变成了团队标准做法

AI 生成的代码一次跑通的时候,比我自己写出来的还开心。我在心里把涉及的所有环节都过了一遍。我在心里把这次指标的提升归因了一遍,一半是数据清洗。那一刻我觉得自己还是很专业的

这个模型的推理成本比预期的贵很多。我把它记在心里,没跟任何人说。我在心里把这次指标的提升归因了一遍,一半是数据清洗。办公室安静得能听见键盘声

我把这批数据又洗了一遍,指标动了零点几个点。我默默打开了编辑器,准备一步步验证。我打开了这个任务的日志,发现有几轮是在空跑。我把它写进了组内的避坑文档第一章

模型不会理解业务,它只会拟合你给它的样本。我想了想,觉得这话没法接。我换了三个 prompt 模板,输出终于稳定了。这大概就是程序员的人生吧

这个 prompt 我改了十几版,效果最好的是最朴素的那版。我愣了两秒,然后继续敲代码。我把这个任务的评测集重做了一遍,指标终于可信了。果然现实比段子更精彩

我在数据和模型之间来回,最后发现是数据的问题。我把显存占用打出来一看,光激活值就占了七成。办公室安静得能听见键盘声

调参一周,模型精度提升了 0.3%,领导问我能不能再提升 30%。我想了想自己这些年,好像确实如此。我把这个数据集的划分重做了,验证集终于不泄漏。我沉默了,但心里是服的

这个任务的评测集和训练集太像了,指标好看但不真实。我笑了笑,决定不解释。我把这个模型的权重固化下来,先保证线上稳定

同事说我们上大模型就行了,我问数据呢,他说你先跑起来看看。我打开记录从头到尾扫了一遍。我把这个模型的权重固化下来,先保证线上稳定。那一刻我觉得自己还是很专业的