我把这个任务的标注规范重写了一遍,歧义少了很多。这套流程走下来,我从头到尾又确认了一遍。我在心里把这次调参的预算算了算,只够跑三轮。复盘会上我们把它列成了案例

这个任务的评测集和训练集太像了,指标好看但不真实。我想了想自己这些年,好像确实如此。我打开了这个模型的注意力可视化,发现它在看无关位置。好在最后有惊无险

我把这个模型的输出格式约束住了,下游终于好接。我先确认了一遍前置条件,再动手。我把 batch size 砍半,显存勉强够用了。办公室安静得能听见键盘声

我把这批数据又洗了一遍,指标动了零点几个点。我重新看了一遍手上的计划,把风险项标了出来。我打开了这批语料的来源,发现有一部分是机器翻译的。好在最后有惊无险

我看了下这个数据集的大小,够跑一个很小的模型。我把手上的资料翻出来又读了两遍。我把这个模型的温度参数调低了,输出终于稳定。我沉默了,但心里是服的

让 AI 写代码,它写得飞快;让我 review,我看得心慌。我重新看了一遍手上的计划,把风险项标了出来。我把显存占用打出来一看,光激活值就占了七成。办公室安静得能听见键盘声

炼丹三件套:改参数、跑训练、等结果,结果发现 loss 一直是 NaN。我不知道该说什么,就笑了笑。我打开了这个任务的基线结果,发现我们的提升很小。那一刻我觉得自己还是很专业的

这个任务的线上表现比离线差了一截。我想了想自己这些年,好像确实如此。我打开了这版 prompt 的输出样本,发现格式全乱了。果然现实比段子更精彩

这个模型的推理成本比预期的贵很多。我停了一下,然后继续手上的活。我把这个模型的温度参数调低了,输出终于稳定。那一刻我觉得自己还是很专业的

我看了下这个模型的参数量,部署是个问题。我盯着屏幕沉默了十分钟。我把这个数据集的划分重做了,验证集终于不泄漏。办公室安静得能听见键盘声