大規模言語モデル(LLM)の Memorization(訓練データの暗記) に関する日本語の非公式リンク集です。 定義・定量化手法・実証的知見・抑制手法・社会的課題を、話題ごとにまとめています。
本サイトの特徴は、LLM Wiki として運用している点です。 次のサーベイ論文を軸とし、LLM が話題ごとの知見の統合と相互リンクを維持しています。
石原祥太郎, 高橋寛武「大規模言語モデルの訓練データ暗記の研究動向」 人工知能学会論文誌 41巻4号 AN40-F (2026). DOI: 10.1527/tjsai.41-4_AN40-F
サーベイが提示する 訓練セット・モデル・出力という 3 軸(同論文 図1)を、 そのままページの組織原理として採用しています。 新しい資料を取り込むときは、必ずこの 3 軸のどこに位置づくかを明示します。
構築の方針は tsurubee さんの「LLM Wiki:知識を繋げる」を参考にしています。 「質問のたびに知識をゼロから再発見する」RAG ではなく、繋がりが永続的に蓄積される知識ベースを目指しています。
直近の更新の抜粋です(全履歴は操作ログ)。
話題ごとに、概念ページ(定義・主要な論文・横断的知見・未解決の問い)を案内します。
| 軸 | 定量化(3章) | 実証的知見(4章) | 抑制(5章) |
|---|---|---|---|
| 訓練セット | — | 文字列の重複 学習順と忘却 |
重複排除 |
| モデル | 反実仮想 差分プライバシ |
モデルサイズ | 学習過程での抑制 逆学習 知識編集 |
| 出力 | 文字列の類似度 メンバーシップ推論 知識を問うタスク |
文脈長 | 出力の制御・電子透かし |
課題(6章): セキュリティ・著作権・評価の正当性 展望(7章): 評価の枠組み・ドメインや言語横断・研究領域の拡張
各論文の要約と、Wiki 内のどの概念と繋がるかをまとめています。
複数のページを突き合わせて初めて見えた繋がりを、質問の形でファイリングしています。
stub: true と明記しています。
現在 19 本が stub(サーベイ経由の記述)です。被参照数の多い順に解消しています。CLAUDE.md # スキーマ定義(命名規約・frontmatter・必須セクション・運用ルール)
.claude/skills/ # ingest-paper / ingest-article / query / lint
tools/verify_wiki.py # リンク・必須セクション・双方向リンクの検査
docs/raw/ # 一次資料(PDF は Git 管理外)
docs/wiki/ # Wiki 本体。Obsidian Vault としても開ける
Claude Code をこのディレクトリで起動してスキルを呼びます。
> /ingest-paper https://arxiv.org/abs/XXXX.XXXXX
> /query 日本語で重複排除は有効か?
> /lint
検査は手元でも実行できます(CI でも走ります)。
python3 tools/verify_wiki.py
日本語 PDF の本文抽出には poppler の pdftotext -enc UTF-8 を使ってください
(pypdf は CID フォントで文字化けします)。
brew install poppler
本リポジトリのコンテンツは MIT License で提供します。
docs/raw/ に置く一次資料(論文 PDF 等)は各出版社の権利に従うため、Git 管理外としています。