軸: 出力 Transactions of the Association for Computational Linguistics, Vol. 11, pp. 652–670 | stub(原論文未読)

How much do language models copy from their training data?(RAVEN)

TL;DR

生成文の新規性(novelty)に着目した分析を実施し、 言語モデルが訓練データからの大規模な複製を実施すると報告した。

位置づけ

出力軸。著作権(6·2 節、新規性の欠如による盗用)の主要な証拠。 文字列の重複モデルサイズ の知見も支持している。

手法・実験

RAVEN という枠組みで、生成テキストの言語的新規性を評価する。 サーベイからは実験設定の詳細は判明しない(原論文未読)。

主要な知見

限界・批判

Wiki 内の接点