[長篇評論] 資料去重複使語言模型更優秀
資料去重複聽起來很無聊,直到你發現 C4 中單句 61 字的句子出現超過 60,000 次,以及在這樣語料庫訓練的語言模型會以令人不安的方式向使用者吐出訓練集文本的一部分
資料去重複聽起來很無聊,直到你發現 C4 中單句 61 字的句子出現超過 60,000 次,以及在這樣語料庫訓練的語言模型會以令人不安的定期性向使用者吐出訓練集文本。這篇針對 Google 論文《資料去重複使語言模型更優秀》的長篇評論深入探討近似重複偵測和長子字串匹配如何重塑現代 LLMs 的損失景觀、記憶行為和評估有效性。
期待詳細走過兩個提議的去重複管道、使其在網絡規模上易於處理的後綴陣列技巧,以及清潔資料產生十倍更少記憶加上更快收斂至相同或更好精度的經驗證據。對於微調 LLMs 進行對話的語音 AI 從業人員,或在抄本密集的語料庫上訓練語音基礎模型,訊息直接轉譯:洩露的評估句子和複製貼上生成始於重複訓練行。如果資料管道決策落在你的桌子上,這次深度探討值得花你一個下午。
