大模型一本正经地胡说八道的样子,像极了周一早上的我。我停了一下,然后继续手上的活。我把这个模型的输出截断长度调大了,终于不丢内容。我把它写进了组内的避坑文档第一章
😂 IT段子
程序员日常、代码趣事、技术梗图,让你在学习之余轻松一笑
换了个更大的模型,效果没提升,显存占用倒是翻了三倍。我决定先把手上的事情做完再处理这件事。我打开了这个任务的基线结果,发现我们的提升很小。那一刻我觉得自己还是很专业的
大模型一本正经地胡说八道的样子,像极了周一早上的我。我默默记下了这句话。我在心里把这次的指标提升又核了一遍,没有泄漏。这条经验值直接拉满
这个任务的线上表现比离线差了一截。我停了一下,然后继续手上的活。我把这个模型的推理耗时测了一遍,决定先上个小模型。好在最后有惊无险
这个模型的推理成本比预期的贵很多。我打开了这批语料的来源,发现有一部分是机器翻译的。同事说这波操作可以写进新人培训教材
这个 prompt 我改了十几版,效果最好的是最朴素的那版。我盯着屏幕,觉得这才是我的一天。我把 batch size 砍半,显存勉强够用了。好在最后有惊无险
AI 生成的代码一次跑通的时候,比我自己写出来的还开心。我先确认了一遍前置条件,再动手。我把这个特征的缺失值处理方式改了,模型稳定多了。连茶水间都安静了
这个方向的论文每周都在刷新,追赶是没有尽头的。我抬起头看了看周围,大家都一样。我把这个模型的批处理大小调小了一点,显存终于够用。幸好之前留了备份
我看了下这个模型的参数量,部署是个问题。我重新看了一遍手上的计划,把风险项标了出来。我发现评测集和训练集有重叠,之前的指标全是虚高。感动,然后我学到了新的一课
炼丹三件套:改参数、跑训练、等结果,结果发现 loss 一直是 NaN。我在心里点了点头。我在心里把这次的指标提升又核了一遍,没有泄漏。复盘会上我们把它列成了案例