エージェント対戦コンペ
予測値ではなくエージェントを提出し、参加者同士やモデル同士の対戦で順位を競う形式のコンペです。
Kaggle のシミュレーションコンペとして以前から存在する形式ですが、LLM の登場以降は大型対戦コンペやモデル評価基盤としても活用されています。
押さえどころ
- Kaggle のシミュレーションコンペでは、提出したエージェントが他の参加者のエージェントと対戦し、レーティングで順位が決まる。通常のコンペとは提出物も評価の仕組みも異なる(公式ドキュメント)
- 2026 年にはポケモンカードゲームを題材にした「The Pokémon Company - PTCG AI Battle Challenge」のような、公式ゲームエンジン提供、2 トラック構成、トーナメント決勝を備えた大型対戦コンペが登場した
- Kaggle 自体もチェス、ポーカー、人狼などでモデル同士を対戦させる評価基盤「Game Arena」を展開しており、ゲームを agentic な振る舞いの統制されたサンドボックスと位置づけている(Google 公式ブログ)。プラットフォームの評価基盤化は性能評価と検証も参照
- 国内でも SIGNATE「空戦AIチャレンジ」など対戦型コンペが継続的に開催されている(コンペ解法に優勝解法を掲載)
- 解法はヒューリスティック、強化学習、LLM の組み合わせが主流で、ヒューリスティックが強化学習に劣らない事例も多い(「Halite」AIコンペからの知見まとめ記事)。強化学習ライブラリでは HandyRL が複数のコンペで優勝や上位入賞の実績がある定番となっている。ヒューリスティックの基礎は数理最適化コンペと地続きである
- 強化学習は学習の進捗判断自体が難しく、専用のデバッグや検証手順を組む必要がある。対戦相手、先攻後攻、乱数シードを揃えずに勝率を比較すると改善を見誤るため、評価用エージェントを複数用意して条件を固定する必要がある(ポケカコンペの参加録)
- 解法の構築には定石の順序がある。手作りのルールベースから始め、数手先の探索、局面から勝率を予測する価値関数、上位エージェントの行動クローン、自己対戦による方策の微調整、公開情報からの相手デッキ推定へと段階的に拡張していく進め方が定石である。価値関数の学習データは自己対戦の局面から数十万件規模で生成できる
- 2026 年には、エージェント同士を戦わせるのではなくエージェントを攻撃対象に据える形式も現れた。「AI Agent Security - Multi-Step Tool Attacks」はツールを使う LLM エージェントへの多段階攻撃を生成するコードを提出する形式で、対戦相手ではなくガードレールと採点系の検査範囲のずれが攻略の焦点になった。金メダル解法では応答時間や応答長から非公開ガードレールや Private 環境で遮断されているツールを特定し、速度あたりスコアの評価に合わせて KV キャッシュ再利用や対数尤度による事前選別で推論を高速化している(コンペ解法に金・銅メダル解法と参加録を掲載)。形式の位置づけはコンペ形式・技術動向の変遷も参照
- 「エージェントを道具として使って通常のコンペを戦う」話題はAI エージェント活用へ
資料
Kaggle公式・評価基盤・大型対戦コンペ
対戦形式コンペの解法・参加録
強化学習ライブラリ・学習リソース
関連概念