换了个更大的模型,效果没提升,显存占用倒是翻了三倍。我先确认了一遍前置条件,再动手。我在心里给这个任务的可解性打了个问号,数据不够。从此我多了一条团队规约
😂 IT段子
程序员日常、代码趣事、技术梗图,让你在学习之余轻松一笑
炼丹三件套:改参数、跑训练、等结果,结果发现 loss 一直是 NaN。我忽然觉得,这可能就是这一行的常态。我加了个正则项,过拟合总算被压住了一点。好在最后有惊无险
AI 会取代程序员吗?会,但先取代的是不学 AI 的程序员。我不知道该说什么,就笑了笑。我打开了这个任务的耗时分布,发现瓶颈在数据加载。我沉默了,但心里是服的
这个方向的论文每周都在刷新,追赶是没有尽头的。我把这个模型的输出截断长度调大了,终于不丢内容。那一刻我觉得自己还是很专业的
训练了三天的模型上线了,用户说它回答得不如随机。我先给自己泡了杯茶,做好了打持久战的准备。我把这个接口的返回做了结构化约束,前端终于好解析
我看了下这个数据集的大小,够跑一个很小的模型。我在心里把涉及的所有环节都过了一遍。我把这批数据重新洗了一遍,模型的输出终于正常了。连茶水间都安静了
模型的输出很流畅,内容经不起核对。我想反驳,但发现他说得对。我把这个提示词加了几个示例,输出质量立刻上来了。从此我多了一条团队规约
我把这个模型的输出格式约束住了,下游终于好接。我决定先把手上的事情做完再处理这件事。我打开了这版 prompt 的输出样本,发现格式全乱了。我沉默了,但心里是服的
这个任务的评测集和训练集太像了,指标好看但不真实。我发现自己居然没法反驳。我把训练集重新清洗了一遍,发现脏数据占了百分之十五。那一刻我觉得自己还是很专业的
我把这个模型的输出格式约束住了,下游终于好接。我把这个模型的输出做了兜底,异常时返回默认答案。果然现实比段子更精彩