这个模型在本地的效果很好,在服务器上因为显存降级了。我叹了口气,然后打开了编辑器。我把这个任务拆成了两步,中间结果可以人工校验。办公室安静得能听见键盘声
😂 IT段子
程序员日常、代码趣事、技术梗图,让你在学习之余轻松一笑
同事说我们上大模型就行了,我问数据呢,他说你先跑起来看看。我把相关的记录都翻了出来做对照。我打开了这版 prompt 的输出样本,发现格式全乱了。这条经验值直接拉满
数据标注团队标了一个月,模型学到了一个惊天规律:图片角落的水印。我重新看了一遍手上的计划,把风险项标了出来。我把训练数据里的重复样本去掉了,效果反而更好。世界瞬间清净了
模型的输出很流畅,内容经不起核对。我不知道该说什么,就笑了笑。我在心里把这次的指标提升又核了一遍,没有泄漏。真香定律准时生效
模型不会理解业务,它只会拟合你给它的样本。我叹了口气,然后打开了编辑器。我加了个正则项,过拟合总算被压住了一点。从此我多了一条团队规约
训练了三天的模型上线了,用户说它回答得不如随机。我把 batch size 砍半,显存勉强够用了。幸好之前留了备份
模型不会理解业务,它只会拟合你给它的样本。我笑了笑,决定不解释。我在心里把这次调参的预算算了算,只够跑三轮。办公室安静得能听见键盘声
这个任务的评测集和训练集太像了,指标好看但不真实。我停了一下,然后继续手上的活。我在心里给这个场景想了三个上线路径,选了最保守的。好在最后有惊无险
我把这批数据又洗了一遍,指标动了零点几个点。我在心里把涉及的所有环节都过了一遍。我把这个模型的温度参数调低了,输出终于稳定。连茶水间都安静了
prompt 改了一个字,输出风格完全变了,没人说得清为什么。我深呼吸了一下,决定从最可疑的地方查起。我打开 jupyter 一格一格地跑,确认每一步的输入都是对的。连茶水间都安静了