[短篇评论] 数据去重使语言模型更好
你的语言模型的"泛化"有多少实际上只是简单的复述?
你的语言模型的"泛化"有多少实际上只是简单的复述?Google Research给出了一个数字:超过1%的无提示LM输出是从训练数据中逐字复制的,并且像C4这样的标准语料库包含重复数万次的句子。他们的论文介绍了两个高效的去重工具,可以从网络规模数据集中去除近似重复和长重复子串,产生了显著的下游效应。
在清洁数据上训练的模型记忆化减少十倍,收敛步骤更少,并产生更可靠的评估数字,因为训练-测试重叠也大幅下降。对于为对话代理构建LLM后端或在抓取的转录本上训练语音-语言模型的语音AI团队来说,这是一个提醒,数据集卫生往往胜过架构的聪慧。这篇短篇评论涵盖了去重算法、记忆化测量和发布的代码。如果数据质量与你的下一个冲刺相关,这值得你花五分钟阅读。
