
Apple Machine Learning Research部門の専門家らは、現代の言語・視覚モデル(VLM)がテキスト情報のみに依存せず、視覚情報だけに基づいて推論する能力に限りがあることを示す論文を発表した。複雑なテキスト指示に従うことはできても、現在のシステムは画像のセットから一般的な概念を正しく抽出し、それを新しい入力データに適用することができない。
この問題に対応するため、研究者らは「Visual Concept Inference from Sets(VICIS)」という新しい評価タスクを発表した。この手法の本質は、共通のアイデアで結び付けられた少数のコンテキスト画像セットとターゲットクエリをモデルに提供することにある。システムには、コンテキストセットによって定義された概念を保持しつつ、かつクエリとも整合性のある新しい画像を生成することが求められる。
このイニシアチブは、AI 評価におけるギャップを埋め、焦点をテキスト理解から純粋な視覚的論理的思考へとシフトさせることを目指している。VICIS タスクの導入により、テキストの手掛かりに頼らない抽象的な視覚的汎化におけるモデルの進捗を、より正確に測定できるようになる。
編集部コメント
なぜ重要か
VICIS タスクは視覚的知能をテストするための新たな業界標準となり、テキストアンカーへの依存度が低いアーキテクチャの開発を促進すると予想される。次に観測される兆候は、このベンチマークにおける主要モデルのテスト結果に関する報告書の登場となるであろう。主な不確実性は、研究者らが画像学習への現在のアプローチが抱える根本的な制限を克服できる速度に残っている。