Hugging Face : comment accélérer l'inférence LoRA de 300 % en gardant le modèle de base chaud
Goodbye cold boot - how we made LoRA Inference 300% faster
Hugging Face a réduit le temps de démarrage à froid de l'inférence LoRA de 25 s à 3 s et le temps de réponse de 35 s à 13 s en gardant le modèle de base Stable Diffusion XL chargé et en échangeant les adaptateurs LoRA à la demande. Le Hub héberge environ 2500 LoRA publics, dont environ 92 % reposent sur Stable Diffusion XL Base 1.0, et cette mutualisation permet de servir des centaines de LoRA distincts avec moins de 5 GPU A10G. L'article détaille l'implémentation dans Diffusers avec load_lora_weights, fuse_lora, unload_lora_weights et unfuse_lora, ainsi que les temps de chargement et d'inférence mesurés sur T4 et A10G.
L'article détaille le mécanisme de mutualisation des adaptateurs LoRA et les gains mesurés, utile pour ceux qui déploient plusieurs modèles fine-tunés.
Source :Hugging Face Blog · huggingface.co