Q. 暗記の 3 因子(重複・モデルサイズ・文脈長)のうち、日本語で崩れるのはどれか

A. 文脈長だけが崩れる

因子 日本語 他の低資源言語 根拠
文字列の重複 再現 Kiyomaru 24 / Ishihara 24 / Takahashi 25b
モデルサイズ 再現 再現 Kiyomaru 24 / Satvaty 25
文脈長 逆転 [小柳 24]、Takahashi 25b(一部の実験)

英語での原典はいずれも Carlini 23b

なぜこの問いをファイリングしたか

Ishihara 26 7·2 節は 「暗記の普遍的要因と文脈依存的要因を切り分ける研究が期待される」と述べるが、 現時点でどこまで切り分けられているかは 4·4 節と 7·2 節に分散していて一覧できない。 3 つの概念ページと 4 つの論文ページを突き合わせて初めて上の表になる。

この整理は ドメインや言語横断## 横断的知見 に還元済み。

逆転の原因として切り分けられていない候補

  1. 言語特性 — 日本語には語境界が無い。トークナイザとしてユニグラム言語モデル [Kudo 18] が普及しており、トークン分割が影響する可能性 Ippolito 23
  2. 定量化手法 — 反例はいずれも メンバーシップ推論 の設定である。 日本語で文字列類似度ベースの文脈長分析が 同様に行われたかは、この Wiki では未確認
  3. ドメインTakahashi 25b は 継続事前学習という特殊な設定
  4. 評価セットの構成Das 25 が示したように、 メンバーシップ推論の性能は正例・負例の分布差に強く影響される。 「文脈長が短いほど性能が高い」が暗記ではなく分布差の検出しやすさを 反映している可能性(推測)→ 評価セットとライブラリ

次に調べるべきこと

Wiki 内の接点

文脈長 / ドメインや言語横断 / 文字列の重複 / モデルサイズ