軸: 出力 3rd Workshop on Trustworthy Natural Language Processing (TrustNLP 2023), pp. 260–275

Training data extraction from pre-trained language models: A survey

TL;DR

事前学習済み言語モデルからの訓練データ抽出に関する初の包括的サーベイ。 Carlini 21 を引用する 100 本超を体系化し、 暗記の定義の分類・攻撃と防御・実証的知見・今後の方向性を整理した。 Ishihara 26 の前身。

位置づけ

出力軸。Ishihara 26 は本論文の発展版であり、 「その後の研究動向を踏まえて内容を再構成・追記した」と明記されている。

2023 → 2026 での主な拡張:

観点 2023(本論文) 2026
対象 訓練データ抽出 暗記全般
体系 定義の分類 / 攻撃・防御 / 実証的知見 訓練セット・モデル・出力の 3 軸
モデル軸の定義 反実仮想差分プライバシを明示的に整理
社会的課題 著作権評価の正当性(6 章)
文献数 100 本超 約 180 本

手法・実験

サーベイ論文。Carlini 21 を引用する論文を、 関係性・被引用数・採択状況で選別するという明示的な手続きで文献を収集している。 起点となる 1 本から前向きに辿る方法であり、この分野が単一の論文から急速に広がったことを反映する。

主要な知見

限界・批判

Wiki 内の接点