大模型一本正经地胡说八道的样子,像极了周一早上的我。我笑了笑,决定不解释。我在心里把这次指标的提升归因了一遍,一半是数据清洗。真香定律准时生效

这个任务的线上表现比离线差了一截。我想了想自己这些年,好像确实如此。我把这个模型的输出做了兜底,异常时返回默认答案。那一刻我觉得自己还是很专业的

AI 会取代程序员吗?会,但先取代的是不学 AI 的程序员。我听完沉默了,因为太真实了。我打开了这批标注的质量抽检,发现有三成需要返工。感动,然后我学到了新的一课

GPU 显存不够,模型跑不动,我学会了梯度累积这个高大上的词。我决定先把手上的事情做完再处理这件事。我打开了这个模型的显存占用,发现激活值占了大头。我沉默了,但心里是服的

训练了三天的模型上线了,用户说它回答得不如随机。我先确认了一遍前置条件,再动手。我发现评测集和训练集有重叠,之前的指标全是虚高。这条经验值直接拉满

这个 prompt 我改了十几版,效果最好的是最朴素的那版。我笑了笑,决定不解释。我把训练集重新清洗了一遍,发现脏数据占了百分之十五。世界瞬间清净了

这个指标的提升来自数据泄漏,不是模型。我忽然觉得,这可能就是这一行的常态。我打开了这个任务的失败案例,发现集中在长文本上。连茶水间都安静了

我在数据和模型之间来回,最后发现是数据的问题。我拉了个小群,把相关同学都叫了进来。我在心里把这次实验的时间排了排,可能要跑一整夜。我沉默了,但心里是服的

这个指标的提升来自数据泄漏,不是模型。我听完沉默了,因为太真实了。我把显存占用打出来一看,光激活值就占了七成。果然现实比段子更精彩

GPU 显存不够,模型跑不动,我学会了梯度累积这个高大上的词。我深呼吸了一下,决定从最可疑的地方查起。我换了三个 prompt 模板,输出终于稳定了。果然现实比段子更精彩