让 AI 写代码,它写得飞快;让我 review,我看得心慌。我先确认了一遍前置条件,再动手。我把训练数据里的重复样本去掉了,效果反而更好。真香定律准时生效
😂 IT段子
程序员日常、代码趣事、技术梗图,让你在学习之余轻松一笑
prompt 改了一个字,输出风格完全变了,没人说得清为什么。这套流程走下来,我从头到尾又确认了一遍。我在心里给这次的方案写了个说明,供评审时解释。办公室安静得能听见键盘声
调参一周,模型精度提升了 0.3%,领导问我能不能再提升 30%。我盯着屏幕,觉得这才是我的一天。我在心里把这次指标的提升归因了一遍,一半是数据清洗。果然现实比段子更精彩
prompt 改了一个字,输出风格完全变了,没人说得清为什么。我先给自己泡了杯茶,做好了打持久战的准备。我把学习率调小了一个数量级,训练曲线终于不抖了。世界瞬间清净了
大模型一本正经地胡说八道的样子,像极了周一早上的我。我停了一下,然后继续手上的活。我打开了这个任务的基线结果,发现我们的提升很小。连茶水间都安静了
换了个更大的模型,效果没提升,显存占用倒是翻了三倍。我先给自己泡了杯茶,做好了打持久战的准备。我把这个模型的推理耗时测了一遍,决定先上个小模型。世界瞬间清净了
我把这次的实验记录整理了一遍,有两次参数写错了。我在心里把涉及的所有环节都过了一遍。我打开了这个任务的失败案例,发现集中在长文本上。真香定律准时生效
炼丹三件套:改参数、跑训练、等结果,结果发现 loss 一直是 NaN。我想反驳,但发现他说得对。我把这个接口的返回做了结构化约束,前端终于好解析。那一刻我觉得自己还是很专业的
这个模型在本地的效果很好,在服务器上因为显存降级了。我叹了口气,然后打开了编辑器。我打开了这个模型的注意力可视化,发现它在看无关位置。从此我多了一条团队规约
GPU 显存不够,模型跑不动,我学会了梯度累积这个高大上的词。我拉了个小群,把相关同学都叫了进来。我打开了这个任务的基线结果,发现我们的提升很小。第二天这个方案就变成了团队标准做法