画像認識・視覚モデルの技術動向
Vision Transformer、CLIP、自己教師あり学習など画像認識分野のモデルや研究動向と、国際会議のサーベイや参加報告をまとめます。
コンペでの実践的な戦い方や定跡は 画像認識コンペ を参照してください。
押さえどころ
- CNN と Vision Transformer(ViT)は競合しつつ補完関係にもある。ViT はデータやパラメータの規模を増やすほど性能が伸びる傾向がある一方、ConvNeXt や EfficientNetV2 など効率重視の CNN 系も改良が続き、中規模データでは依然として強い。
- 日本語 CLIP は継続的に更新されているモデル系譜がある。初期の学習済みモデル公開に始まり、リクルート、Stability AI(Japanese Stable CLIP)を経て、LINEヤフーの clip-japanese-base や同 v2(データフィルタリングと知識蒸留で改善)へと、公開元や手法を入れ替えながら性能が更新されてきた。
- 自己教師あり学習(DINO、SimCLR 系、FixMatch など)はラベルなしデータからの事前学習手法として定着している。医療画像などラベル付きデータが乏しい領域のほか、DINO は atmaCup 上位解法での実利用例もある。
- Segment Anything(SAM や SAM2)や DINOv3 のような汎用視覚基盤モデルは、衛星画像コンペのようなドメインへの転用も進んでおり、汎用モデルを特定タスクへ適応させる流れがコンペにも波及している。
- CVPR、ICCV、ECCV の参加報告資料は、毎年 100〜180 ページを超える大部な資料としてまとめられるのが定番となっている。国際会議の動向は、翌年以降にコンペで使われるモデルや手法の先行指標になりやすい。
- ArcFace に代表される距離学習(metric learning)は顔認識に限らず、Shopee のような類似画像や商品マッチングを扱うコンペでも繰り返し使われる定番手法である。
資料
CLIP・マルチモーダル
自己教師あり学習
国際会議サーベイ・参加報告
モデル・技術動向
関連概念