軸: モデル | サーベイ 5·2 節

逆学習(Machine Unlearning)

定義

特定の訓練データに対して、学習済みのモデルを通常とは逆方向の勾配に ファインチューニングする手法(Ishihara 26 5·2、 [Bourtoule 21], [Liu 25])。特定の訓練データに関する生成が発生しづらくなる効果が期待できる。 強化学習を用いる研究もある [Kassem 23]。

主要な論文

横断的知見

逆学習の理想は 反実仮想そのものである。 「そのデータが最初から無かった状態のモデル」に戻すことが目標なのだから、 逆学習の成否をどう測るかという問題は、反実仮想暗記をどう測るかという問題に還元される。 そして反実仮想暗記の測定は多数のモデルを学習する必要があり計算コストが高い (Carlini 23b の指摘)。 逆学習の評価が難しいことと、反実仮想的定義が使われないことは同じ根を持つ(推測)。

「削除できない」ことへの事後的な回答という位置づけ。 前処理によるデータの削除は、プライバシの文脈依存性 [Dourish 04, Nissenbaum 09] のため文字列だけからは判定できず限界がある (Brown 22)。 逆学習は「学習後に削除要求が来る」現実——忘れられる権利や GDPR——に対応する唯一の手段である。 つまり抑制手法の 3 段階のうち、唯一「事後に発生した要求」に応えられる層である。

自然な忘却との関係が未整理である。 学習中には暗記と忘却が並行して発生している [Duan 24]。 一度しか出現しない文字列は「忘却され続ける」[Leybzon 24]。 逆学習が誘導する忘却が、この自然な忘却と同じ機構を使っているのか、 それとも表層的に生成を抑えているだけなのかは、この Wiki では区別できていない。 後者なら 出力の制御に近く、 Ippolito 23 の「偽りの安心感」批判が同様に当てはまる可能性がある。

メンバーシップ推論への防御としても機能する。 [Tran 25] は トークンの絞り込みがメンバーシップ推論に対する防御に役立つと報告した。 ただし 電子透かしでも同様に メンバーシップ推論の成功確率が低下することが観測されており [Panaitescu-Liess 25]、「メンバーシップ推論が効かなくなること」は 暗記が消えたことの証拠にならない。防御と測定不能化の区別が要る。

未解決の問い