軸: 出力 ICLR 2024 | stub(原論文未読)

Detecting pretraining data from large language models(Min-K% Prob / WikiMIA)

TL;DR

Min-K% Prob(生成確率の低い K% のトークンのみに着目して平均対数尤度を計算)と、 評価セット WikiMIA を提案した。事前学習データ検出の標準的な出発点になった。

位置づけ

出力軸。メンバーシップ推論 の言語モデル向け代表手法。 提案手法と評価セットが同時に標準化された点が、後の批判の焦点になる → 評価セットとライブラリ

手法・実験

Min-K% Prob: 生成確率の低い K% のトークンのみに着目し平均の対数尤度を計算すると、 メンバーシップ推論の性能が上がることを実証的に示した。

WikiMIA: Wikipedia を元に構築。 2017 年以前に作成され訓練セットに含まれると期待される記事を正例、 評価対象モデルの公開後(2023 年以降)に作成された記事を負例とする。

主要な知見

限界・批判

この Wiki で最も重い批判が集まっている論文である。

Wiki 内の接点