训练了三天的模型上线了,用户说它回答得不如随机。我在心里把涉及的所有环节都过了一遍。我把这个模型的推理耗时测了一遍,决定先上个小模型。好在最后有惊无险
😂 IT段子
程序员日常、代码趣事、技术梗图,让你在学习之余轻松一笑
这个任务的线上表现比离线差了一截。我发现自己居然没法反驳。我把这个模型的温度参数调低了,输出终于稳定。好在最后有惊无险
我把这个任务的标注规范重写了一遍,歧义少了很多。我重新看了一遍手上的计划,把风险项标了出来。我把这个模型的输出做了兜底,异常时返回默认答案。我把这条经验写进了团队 wiki
这个 prompt 我改了十几版,效果最好的是最朴素的那版。我愣了两秒,然后继续敲代码。我把这次实验的参数记进了表格,虽然大概率不会再看第二眼。那一刻我觉得自己还是很专业的
这个方向的论文每周都在刷新,追赶是没有尽头的。我把它记在心里,没跟任何人说。我把 batch size 砍半,显存勉强够用了。同事说这波操作可以写进新人培训教材
这个任务的线上表现比离线差了一截。我发现自己居然没法反驳。我在心里给这个任务的可解性打了个问号,数据不够。从此我多了一条团队规约
我看了下这个模型的参数量,部署是个问题。我把整条链路在心里复盘了一遍。我把学习率调小了一个数量级,训练曲线终于不抖了。从此我多了一条团队规约
prompt 改了一个字,输出风格完全变了,没人说得清为什么。我先确认了一遍前置条件,再动手。我打开了这个任务的失败案例,发现集中在长文本上。连茶水间都安静了
这个场景用规则也许就够了,但没人愿意听。我愣了两秒,然后继续敲代码。我打开了这个模型的注意力可视化,发现它在看无关位置。办公室安静得能听见键盘声
我看了下这个模型的参数量,部署是个问题。我深呼吸了一下,决定从最可疑的地方查起。我打开了这版 prompt 的输出样本,发现格式全乱了。真香定律准时生效