軸: 訓練セット / モデル / 出力 INLG 2024, pp. 584–596 | stub(原論文未読)

A comprehensive analysis of memorization in large language models

TL;DR

日本語を対象に、続きを生成する方法で暗記を定量化し、 英語での実証的知見が日本語でも再現されると確認した。

位置づけ

3 軸すべて。Ishihara 26 4·4 節が、 日本語に関する研究として最初に挙げる論文。

手法・実験

続きの生成(サーベイ図2 の手法)による暗記の定量化。

主要な知見

限界・批判

Wiki 内の接点