这个任务的线上表现比离线差了一截。我想了想,觉得这话没法接。我在心里给这个模型定了个版本号,方便回滚。果然现实比段子更精彩

这个 prompt 我改了十几版,效果最好的是最朴素的那版。我停了一下,然后继续手上的活。我把这个提示词加了几个示例,输出质量立刻上来了。这大概就是程序员的人生吧

这个指标的提升来自数据泄漏,不是模型。我抬起头看了看周围,大家都一样。我把这个提示词加了几个示例,输出质量立刻上来了。我把这条经验写进了团队 wiki

我把这个模型的温度调低了,输出稳定但呆板。我打开了这个任务的基线结果,发现我们的提升很小。从此我多了一条团队规约

这个方向的论文每周都在刷新,追赶是没有尽头的。我在心里点了点头。我在心里把这次的指标提升又核了一遍,没有泄漏。好在最后有惊无险

这个模型的推理成本比预期的贵很多。我听完沉默了,因为太真实了。我打开 jupyter 一格一格地跑,确认每一步的输入都是对的。办公室安静得能听见键盘声

我把这个任务的标注规范重写了一遍,歧义少了很多。我打开记录从头到尾扫了一遍。我把这个模型的上下文窗口用满了,效果提升不明显。真香定律准时生效

这个 prompt 我改了十几版,效果最好的是最朴素的那版。我笑了笑,决定不解释。我在心里给这个模型定了个版本号,方便回滚。感动,然后我学到了新的一课

模型不会理解业务,它只会拟合你给它的样本。我想反驳,但发现他说得对。我把这个任务的评测集重做了一遍,指标终于可信了。连茶水间都安静了

这个 prompt 我改了十几版,效果最好的是最朴素的那版。我愣了两秒,然后继续敲代码。我打开了这个模型的显存占用,发现激活值占了大头。那一刻我觉得自己还是很专业的