軸: 訓練セット / モデル NeurIPS 2022 | stub(原論文未読)

Memorization without overfitting

TL;DR

大規模言語モデルは過学習に至る前に大半のデータを暗記し、その後も情報を忘れにくい。 「暗記 = 過学習」という素朴な等式を訓練ダイナミクスの観測から否定した。

位置づけ

訓練セット軸・モデル軸。暗記 の中心命題 「暗記は単なる過学習の副産物ではない」を最も直接的に支える証拠。 サーベイでは 2 章(自己回帰型モデルの参照)と 5·2 節(正則化の限界)で言及される。

手法・実験

訓練ダイナミクスの追跡。暗記をトークン単位で議論している点が特徴 (文字列の類似度 の単位の議論)。 サーベイからは実験設定の詳細は判明しない(原論文未読)。

主要な知見

限界・批判

Wiki 内の接点