軸: 訓練セット / モデル FAccT 2022, pp. 2280–2292

What does it mean for a language model to preserve privacy?

TL;DR

データのサニタイズと差分プライバシは、自然言語データの大半には成り立たない仮定を置いている。 データ保護はプライバシ保護と等価ではない。 結論として、言語モデルは明示的に公開用途で作られたテキストだけで学習すべきだと主張する。

位置づけ

訓練セット軸・モデル軸の両方に、同じ根本問題として現れる批判。 サーベイでは 3·1§2(差分プライバシの限界)と 5·1(データ削除の限界)の 2 箇所で引用される。

この Wiki で最も規範的な主張を持つ論文である。他の批判論文が 「現行手法は不十分」で止まるのに対し、本論文は何をすべきかまで踏み込む。 サーベイはこの処方箋の部分を引用していない。

手法・実験

立場表明・分析の論文であり実験は無い。 Nissenbaum の文脈的完全性(contextual integrity)を規範的な基準として採用する。

主要な知見

1. 2 つの防御が置いている仮定

手法 暗黙の仮定 なぜ成り立たないか
データのサニタイズ 個人情報は形式的に指定でき、容易に認識でき、効率的に除去できる テキスト中の個人情報のうち認識できるのはごく一部にすぎない
差分プライバシ 保護対象の「レコード」が明確に定義され、個々の秘密情報に論理的に対応する 機微な情報は複数人によって書かれ、集団で共有されるのが常であり、境界がぼやける

差分プライバシの意味論的保証は「任意の 1 レコードが学習に使われたか敵対者が識別できない」ことである。 境界が明確に定義できる情報にしか意味のある保証を与えられない。

2. 望ましいプライバシの定義

ユーザのデータが、本人が想定した文脈の外に現れない(また推論されない)ことを保証すべきである (推論攻撃の存在下で文脈的完全性を尊重する)

これは、情報が生成・利用・共有される文脈の深い理解なしには達成できない。 現在の言語モデルは、人間が自然に行っている「この情報をこの相手と共有してよいか」の 文脈判断ができるようには設計されていない。

3. 「公開されている」と「公開を意図された」は違う

Web スクレイプは一見プライバシリスクが無いように見えるが、

4. 個別ユーザによるインフォームド・コンセントは成立しない

  1. 自分のデータを訓練セットに入れることのリスクを、研究者がまだ定量化できていない
  2. あるユーザの個人情報は、他の多くのユーザのテキストに含まれている。 1 人のユーザが、自分が寄与した全テキストの扱いを指定することはできない

5. 暗記は非典型的なデータ点で起きやすい

論文は、言語モデルが非典型的(atypical)なデータ点をとりわけ暗記しやすいこと、 そしてそれがまさにプライバシリスクを表すデータであることを指摘する。 → 対立の台帳 5 番に第 3 の立場を加える論点

限界・批判

Wiki 内の接点