画像認識コンペ
画像認識のコンペは、事前学習済みバックボーンの選択、データ拡張、学習パイプラインの作り込みで競います。
timm などの公開モデルを前提に、いかに速く強いベースラインを立てて育てるかが勝負どころです。ViT、CLIP、自己教師あり学習などの技術動向は 画像認識・視覚モデルの技術動向 を参照してください。
押さえどころ
- バックボーン選択には実証研究の知見が使える。NeurIPS 2023「Battle of the Backbones」のタスク横断評価では、ImageNet-21k 教師あり学習の ConvNeXt が最上位となった。中規模パラメータでは CNN が優位であり、ViT はモデルの大規模化に伴って精度が伸びる傾向を示した。画像分類で強いモデルは、物体検出やセグメンテーションでも強い傾向がある。
- 公開モデルは、「重みは固定したまま処理方法を変える」カスタマイズや、torch.compile や AMP による高速化でタスクに適応させる(野生のモデルを飼い慣らす)。
- ベースラインを構築してから反復改善を進める手順は、イベント掲載の「画像コンペでのベースラインモデルの育て方」などの発表資料が参考になる。
- 音声コンペもスペクトログラムに変換して画像モデルを適用することが多く、画像認識の知見を活用できる(音声コンペ)。
- 画像分類には timm が定番だが、物体検出やセグメンテーションでは MMDetection、OpenMMLab、Segmentation Models PyTorch などの専用ライブラリが使われる。いずれも公開実装を課題に合わせて適切に調整できるかが成果を分ける。
資料
入門・基礎
コンペの定跡
関連概念