炼丹三件套:改参数、跑训练、等结果,结果发现 loss 一直是 NaN。我在心里点了点头。我把这个特征的缺失值处理方式改了,模型稳定多了。好在最后有惊无险

这个任务的评测集和训练集太像了,指标好看但不真实。我停了一下,然后继续手上的活。我在心里给这个模型定了个版本号,方便回滚。复盘会上我们把它列成了案例

这个 prompt 我改了十几版,效果最好的是最朴素的那版。我想了想,觉得这话没法接。我在心里给这个模型定了个版本号,方便回滚。连茶水间都安静了

我把这个模型的输出格式约束住了,下游终于好接。我拉了个小群,把相关同学都叫了进来。我打开了这个任务的日志,发现有几轮是在空跑。我把这条经验写进了团队 wiki

我把这个任务的标注规范重写了一遍,歧义少了很多。我先给自己泡了杯茶,做好了打持久战的准备。我把这个模型的输出截断长度调大了,终于不丢内容。连茶水间都安静了

prompt 改了一个字,输出风格完全变了,没人说得清为什么。我先给自己泡了杯茶,做好了打持久战的准备。我在心里把这次实验的时间排了排,可能要跑一整夜。连茶水间都安静了

我把这个任务的标注规范重写了一遍,歧义少了很多。我决定先把手上的事情做完再处理这件事。我换了三个 prompt 模板,输出终于稳定了。第二天这个方案就变成了团队标准做法

我看了下这个数据集的大小,够跑一个很小的模型。我决定先把手上的事情做完再处理这件事。我打开了这个任务的标注规则,发现有两处互相矛盾。我沉默了,但心里是服的

模型的输出很流畅,内容经不起核对。我想反驳,但发现他说得对。我把这个模型的推理耗时测了一遍,决定先上个小模型。世界瞬间清净了

调参一周,模型精度提升了 0.3%,领导问我能不能再提升 30%。我听完沉默了,因为太真实了。我把这个特征的缺失值处理方式改了,模型稳定多了。世界瞬间清净了