軸: 訓練セット / モデル / 出力 人工知能学会論文誌 41巻4号 AN40-F(特集論文「人工知能学会設立40周年記念論文」)

大規模言語モデルの訓練データ暗記の研究動向

この Wiki の軸となる論文。 本 Wiki の概念ページはすべて、この論文の 訓練セット・モデル・出力という 3 軸(図1)に従って組織されている。 新しいソースを ingest するときは、まずこのページの体系に位置づけること。

TL;DR

約 180 件の既存研究を、訓練セット・モデル・出力という 3 軸で整理した日本語サーベイ。 暗記が単なる過学習の副産物ではなく、文字列の重複・モデルサイズ・文脈長に依存する 現象であることを軸に、定義と定量化(3章)→ 実証的知見(4章)→ 抑制(5章)→ 社会的課題(6章)→ 展望(7章)という一連の流れを体系化する。 2023 年の Ishihara 23 の発展版。

位置づけ

3 軸すべてを扱う唯一のページ。他のサーベイとの差分は本論文自身が明示している。

既存サーベイ 差分
Satvaty 24(意図せぬ暗記)
[Meeus 25], [Wu 25](メンバーシップ推論)
話題を絞っている。本論文は攻撃やメンバーシップ推論以外の定量化手法も含めて幅広く扱う
[Cheng 25b], [Kaneko 25a], [Ravaut 25], [Xu 24](モデル評価の正当性) 本論文はモデル評価を「暗記がもたらす課題の一つ」と位置づけ、より広い視点で整理する
[Wei 25](機械学習一般の暗記)
[Hu 22b](メンバーシップ推論全般)
対象が広い。本論文は言語モデルに絞ることで端的かつ横断的な整理を実現した

対象は Transformer [Vaswani 17] を基盤とした自己回帰型の言語モデル。 BERT のようなマスク型モデルの暗記は 7章の議論にとどめている。 また 3〜5 章では原則として事後学習前のベースモデルを扱う(派生モデルの共通基盤であり、 事後学習の設定差による変動を切り分けるため)。

体系(図1)

3 段階の軸に、定量化・実証的知見・抑制を対応させたのが本論文の骨格である。

軸 3章 定量化 4章 実証的知見 5章 抑制
訓練セット — 文字列の重複 (4·1) 重複排除・データの削除 (5·1 前処理)
モデル 反実仮想に基づく定義 (3·1§1)
差分プライバシ (3·1§2)
モデルサイズ (4·2) 学習過程における抑制 (5·2 学習)
差分プライバシ、正則化、逆学習、知識編集、知識蒸留、PEFT、連合学習
出力 文字列の類似度 (3·2§1)
メンバーシップ推論 (3·2§2)
知識を問うタスク (3·2§3)
文脈長 (4·3) 出力の制御と電子透かし (5·3 後処理)

6章の課題: セキュリティと情報漏洩 (6·1)・著作権 (6·2)・データセット汚染 (6·3) 7章の展望: 評価の枠組み (7·1)・ドメインや言語横断 (7·2)・研究領域の拡張 (7·3)

手法・実験

サーベイ論文であり独自実験は無い。ただし 4 章の骨格は Carlini 23b の実験設定に依拠している: 大規模英語コーパス Pile [Gao 20] で事前学習された GPT-Neo 系モデル [Black 22] (125M / 1.3B / 2.7B / 6B の 4 種類)に対し、Pile から 50,000 文を抽出し、 重複を解析したうえで文頭を一定トークン長に切り出してプロンプトとする。

評価セットの構築手法は 2 種類が図示されている(図2・図3)。両者とも 訓練セットから一部を抽出し、冒頭の数トークンを抜粋する点は共通する。 これは抽出時のバイアスという 7·1 節の論点に直結する。

主要な知見

定義は一枚岩ではない(3章)

暗記の定義は「着目する対象が学習時のモデルか、推論時の出力か」で大別される。 多くの研究は素朴に文字列の類似度に着目するが、 反実仮想や差分プライバシに 基づく定義もあり、メンバーシップ推論 や知識を問うタスクも使われる。

3 つの実証的知見(4章)

Carlini 23b が示し、後続研究で広く再現された 3 点。

  1. 文字列の重複: 重複回数を 2〜900 の塊に分けて測定すると、重複が多いほど暗記されやすい
  2. モデルサイズ: モデルサイズと暗記量の間にほぼ完全な対数線形関係が存在する
  3. 文脈長: 文脈長が大きいほど観測される暗記量が増加する

加えて学習順の影響(学習の後半に用いられたテキストの方が暗記されやすい)が [Duan 24], [Huang 24], [Satvaty 25], [Jagielski 23] で観測されている。 これは暗記と忘却が並行して発生していることを示唆する (学習順と忘却)。

抑制は 3 段階に分類できる(5章)

前処理(訓練セット)/ 学習(モデル)/ 後処理(推論)。この分類は [Hu 22b], [Huang 22a], [Jagielski 23], [Sakarvadia 25] を参考に再構成されたもの。 どの段階の手法も単独では完全ではない——たとえば重複排除は有効だが、 重複以外の要因でも暗記は発生し得るため、それだけでは防げない。

暗記は常に排除すべき対象ではない(7·1)

本論文の規範的な主張として最も重要な一文。実用上は一定の知識保持が有用に働く場合があり (公開事実の想起、特定ドメインの定型表現の再現など)、 許容可能な暗記と深刻度の高い暗記を区別する必要がある。 [Lee 20] は既存研究の多くが暗記された文字列の危険性の程度を区別していないと指摘した。

限界・批判

Wiki 内の接点

このページはハブである。全概念ページからリンクが返ってくる。