[Short Review] Deduplicating Training Data Makes Language Models Better

Tutorials

[ショートレビュー] 訓練データの重複排除により言語モデルが向上する

言語モデルの「一般化」のどれだけが実は単なる丸暗記なのか?

言語モデルの「一般化」のどれだけが実は単なる丸暗記なのか? Google Researchがこれに数値を付けています: プロンプトなしのLM出力の1%以上は訓練データからそのまま複製されており、C4のような標準的なコーパスには数万回繰り返される文が含まれています。彼らの論文では、ウェブスケールのデータセットから近傍重複と長く繰り返されるサブストリングを除去する2つの効率的な重複排除ツールが導入されており、印象的な下流への影響をもたらしています。

クリーンなデータで訓練されたモデルは10分の1の記憶化で済み、より少ないステップで収束し、訓練・テスト間の重複も急激に低下するため、より信頼できる評価数値を生成します。会話エージェント用のLLMバックエンドを構築したり、スクレイプされたトランスクリプトで音声言語モデルを訓練したりする音声AIチームにとって、これはデータセットの衛生管理がしばしば建築上の工夫に勝ることを思い出させます。このショートレビューは、重複排除アルゴリズム、記憶化測定、およびリリースされたコードをカバーしています。データ品質が次のスプリントのどこかに関連がある場合は5分の価値があります。