Google DeepMind publie dans Nature une méthode pour aligner la vision des IA sur celle des humains
Teaching AI to see the world more like we do
Google DeepMind publie dans Nature un article montrant que réorganiser les représentations visuelles d'un modèle selon les hiérarchies conceptuelles humaines améliore sa robustesse et sa généralisation. L'équipe part d'un modèle pré-entraîné SigLIP-SO400M, entraîne un petit adaptateur sur le jeu de données THINGS, puis génère un nouveau jeu de données AligNet de plusieurs millions de jugements de type odd-one-out sur un million d'images pour affiner d'autres modèles. Les modèles alignés obtiennent de meilleurs résultats sur des tâches de sciences cognitives et sur des tâches d'apprentissage few-shot et de distribution shift.
L'article détaille une méthode en trois étapes pour aligner les représentations visuelles des modèles sur les hiérarchies conceptuelles humaines, avec des gains mesurés sur la robustesse et la généralisation.
Source :Google DeepMind · deepmind.google