这个模型的推理成本比预期的贵很多。我发现自己居然没法反驳。我在心里把这次实验的变量控制了一遍,只动了一个。办公室安静得能听见键盘声

这个指标的提升来自数据泄漏,不是模型。我在心里点了点头。我打开了这个任务的基线结果,发现我们的提升很小。连茶水间都安静了

这个模型的推理成本比预期的贵很多。我发现自己居然没法反驳。我把训练集重新清洗了一遍,发现脏数据占了百分之十五。世界瞬间清净了

这个任务的评测集和训练集太像了,指标好看但不真实。我愣了两秒,然后继续敲代码。我打开了这个模型的注意力可视化,发现它在看无关位置。同事说这波操作可以写进新人培训教材

调参一周,模型精度提升了 0.3%,领导问我能不能再提升 30%。我在心里点了点头。我打开了这版 prompt 的输出样本,发现格式全乱了。好在最后有惊无险

我把这个模型的输出格式约束住了,下游终于好接。我先确认了一遍前置条件,再动手。我打开了这个模型的注意力可视化,发现它在看无关位置。好在最后有惊无险

这个指标的提升来自数据泄漏,不是模型。我把这个提示词加了几个示例,输出质量立刻上来了。真香定律准时生效

调参一周,模型精度提升了 0.3%,领导问我能不能再提升 30%。我想反驳,但发现他说得对。我把这个任务拆成了两步,中间结果可以人工校验。我把这条经验写进了团队 wiki

这个方向的论文每周都在刷新,追赶是没有尽头的。我在心里点了点头。我盯着 tensorboard 的曲线看了一整个下午,它一直在抖。我把这条经验写进了团队 wiki

我把这个任务的失败案例整理了一遍,全在长尾。我决定先把手上的事情做完再处理这件事。我打开了这个模型的注意力可视化,发现它在看无关位置。感动,然后我学到了新的一课