Hugging Face Blog·· 2023-05-16AI Score40
Q8-Chat : une expérience d'IA générative efficace sur Xeon grâce à la quantification 8 bits
Smaller is better: Q8-Chat, an efficient generative AI experience on Xeon
AI Introduction
Intel et Hugging Face présentent Q8-Chat, une expérience d'IA générative exécutant des LLM quantifiés en 8 bits sur CPU Xeon. La technique SmoothQuant-O3 compresse des modèles comme OPT 2.7B/6.7B, LLaMA 7B, Alpaca 7B, Vicuna 7B, BloomZ 7.1B et MPT-7B-chat d'un facteur ~2x, avec des métriques majoritairement en amélioration ou marginalement dégradées. Sur un Xeon Sapphire Rapids 32 cœurs, MPT-7B-chat génère du texte en temps réel avec un batch size de 1, offrant flexibilité IT et coût-performance sur CPU.
Source :Hugging Face Blog · huggingface.co