[Short Review] Deduplicating Training Data Makes Language Models Better

Tutorials

[短篇評論] 資料去重複使語言模型更優秀

你的語言模型有多少「泛化」實際上只是原文重複?

你的語言模型有多少「泛化」實際上只是原文重複?Google Research 給出了數字:超過 1% 的未提示 LM 輸出逐字從訓練資料複製,而 C4 等標準語料庫包含重複數萬次的句子。他們的論文介紹了兩個有效的去重複工具,從網絡規模資料集中剝除近似重複和長重複子字串,具有顯著的下游效應。

在清潔資料上訓練的模型記憶減少十倍、更快收斂,並產生更可信的評估數字,因為訓練測試重疊也大幅下降。對於構建 LLM 後端用於對話代理的語音 AI 團隊,或在抓取的抄本上訓練語音語言模型,這是一個提醒:資料集衛生通常勝過架構巧妙性。這篇短篇評論涵蓋去重複演算法、記憶測量和發布的程式碼。如果資料品質與你的下一個衝刺有任何關係,值得花五分鐘。