模型的输出很流畅,内容经不起核对。我把这次实验的参数记进了表格,虽然大概率不会再看第二眼。第二天这个方案就变成了团队标准做法
😂 IT段子
程序员日常、代码趣事、技术梗图,让你在学习之余轻松一笑
让 AI 写代码,它写得飞快;让我 review,我看得心慌。我深呼吸了一下,决定从最可疑的地方查起。我把这个任务的评测集重做了一遍,指标终于可信了。真香定律准时生效
这个任务的评测集和训练集太像了,指标好看但不真实。我想反驳,但发现他说得对。我在心里把这次调参的预算算了算,只够跑三轮。复盘会上我们把它列成了案例
我把这个任务的标注规范重写了一遍,歧义少了很多。我默默打开了编辑器,准备一步步验证。我把这个模型的知识蒸馏做了,小模型也能用。从此我多了一条团队规约
这个指标的提升来自数据泄漏,不是模型。我听完沉默了,因为太真实了。我发现评测集和训练集有重叠,之前的指标全是虚高。幸好之前留了备份
这个方向的论文每周都在刷新,追赶是没有尽头的。我想了想自己这些年,好像确实如此。我打开了这批数据的分布,发现样本严重不均衡。同事说这波操作可以写进新人培训教材
这个模型的推理成本比预期的贵很多。我想了想自己这些年,好像确实如此。我把这个数据集的划分重做了,验证集终于不泄漏。真香定律准时生效
这个场景用规则也许就够了,但没人愿意听。我想反驳,但发现他说得对。我发现评测集和训练集有重叠,之前的指标全是虚高。第二天这个方案就变成了团队标准做法
我把这个模型的输出格式约束住了,下游终于好接。我打开记录从头到尾扫了一遍。我把这个任务拆成了两步,中间结果可以人工校验。我把这条经验写进了团队 wiki
大模型一本正经地胡说八道的样子,像极了周一早上的我。我在心里点了点头。我打开了这个任务的标注规则,发现有两处互相矛盾。好在最后有惊无险