AI エージェント活用
Claude Code などの LLM エージェントを道具としてコンペ作業に活用する手法です。
ベースライン構築や過去解法の調査の自動化が進む一方、上位入賞には人間による問題定義やモデルの改善方針の判断が必要です。
エージェント自体を提出して競わせる形式はエージェント対戦コンペを参照してください。
押さえどころ
- 2023 年時点では ChatGPT の Code Interpreter でコミュニティコンペに挑んで大敗した事例が報告されていたが、2025 年には Claude Code 主体で上位 30% 程度まで到達する事例が出ており、エージェント支援の実用性は短期間で向上している(データコンペでCode Interpreter片手に戦ってみたけど惨敗でした、Claude Code と Kaggle をやったら何も考えずに上位30%になれた話)
- ただしメダル圏への到達には課題が残り、人間の役割はデータ整備、問題定義、改善方針の判断へ移行している。ベースライン作成までの作業が大幅に圧縮された結果、勝負どころは「このコンペで何がスコアを左右するか」を見抜く判断、エージェントが生成したコードの妥当性を検証する CV 設計と評価指標の理解、データの分布差やリーク、時系列特性を踏まえた方針決定に移っている(コーディングエージェント時代のKaggle)
- 2025 年時点の年次レポートでも、完全自律のエージェントが上位入賞した事例はまだ報告されていない(The State of Machine Learning Competitions 2025)。一方、人間とエージェントの協働による金メダル事例は国内でも複数出ている
- Claude Code のほか Cursor、Manus AI、Cline、Devin など複数の AI コーディングツールが使われ、用途に応じた比較検証が進んでいる
- 過去コンペの上位解法を調査してレポートさせる使い方は、コンペ序盤のサーベイを大きく効率化する。skills や agents の構成をコミュニティで共有し比較する動きも出ている
- 協働ではタスクの分担設計が結果を左右する。「方針決定と採否の判定は人間、実装と確認はエージェント」という役割分担が定着しつつある。実験結果をリポジトリと指示ファイルに集約しておけばコンテキスト切れの後も引き継げるため、ローカル GPU 1 枚とスマートフォンからの短い指示だけで金メダルを獲得した事例もある(いま、生成AIにKaggleをどこまで 任せられるか)
- エージェントへの依存度が高まるほど、人間側の判定基準が重要になる。足切りの閾値を誤ると有望な仮説を初期段階で棄却してしまい、リークや探索の行き詰まりもエージェント単独では検知しにくい。また、試行錯誤が高速なぶん構成が過剰に複雑化しやすいため、定期的に簡潔な設計へ戻す整理も求められる
- エージェントと協働するには、実験の再現性と記録が前提になる(実験管理)。ノートブックのクラッシュを集めたベンチマーク(JunoBench)や MLE-Bench など、エージェントの評価基盤も整備されつつある
- エージェントを道具として使う運用のほかに、データ分析やソフトウェア開発のエージェントそのものを競わせるコンペも立ち上がっている。KDD Cup 2026 の「Data Agents for Complex Data Analysis」は異種データの束と自然言語の問いからエージェントに分析手順を組み立てさせる形式で、Kaggle の「Google - The Gemma 4 Developer Agent Competition」は事後学習した Gemma 4 のアダプタとエージェントハーネス、スキル定義を一括提出して開発課題の解決力を競う。いずれもリーダーボードに加えてシステムや論文を審査する別トラック(Creative Track / Paper Track)を併設しており、単一スコアで測りにくい対象をどう評価するかという論点は性能評価と検証と地続きである
資料
関連概念