事前学習済み言語モデルからの訓練データ抽出に関する初の包括的サーベイ。 Carlini 21 を引用する 100 本超を体系化し、 暗記の定義の分類・攻撃と防御・実証的知見・今後の方向性を整理した。 Ishihara 26 の前身。
出力軸。Ishihara 26 は本論文の発展版であり、 「その後の研究動向を踏まえて内容を再構成・追記した」と明記されている。
2023 → 2026 での主な拡張:
| 観点 | 2023(本論文) | 2026 |
|---|---|---|
| 対象 | 訓練データ抽出 | 暗記全般 |
| 体系 | 定義の分類 / 攻撃・防御 / 実証的知見 | 訓練セット・モデル・出力の 3 軸 |
| モデル軸の定義 | — | 反実仮想・差分プライバシを明示的に整理 |
| 社会的課題 | — | 著作権・評価の正当性(6 章) |
| 文献数 | 100 本超 | 約 180 本 |
サーベイ論文。Carlini 21 を引用する論文を、 関係性・被引用数・採択状況で選別するという明示的な手続きで文献を収集している。 起点となる 1 本から前向きに辿る方法であり、この分野が単一の論文から急速に広がったことを反映する。