軸: 訓練セット ACL 2022 (Volume 1: Long Papers), pp. 8424–8445 | stub(原論文未読)

Deduplicating training data makes language models better

TL;DR

訓練セットの重複排除が言語モデルを良くする。暗記の抑制と性能向上を両立させうる、 最も実用的な緩和策。

位置づけ

訓練セット軸の前処理(Ishihara 26 5·1)。 実証的知見の文字列の重複(4·1)に対応する抑制手法。

手法・実験

暗記の測定にトークン一致率を用いた(文字列の類似度)。 サーベイからは重複排除アルゴリズムの詳細は判明しない(原論文未読)。

主要な知見

限界・批判

Wiki 内の接点