Hugging Face Blog·· 12 jsélectionAI Score67
Transformers prend désormais en charge les quantifications llama.cpp
Transformers now runs llama.cpp quants
AI Introduction
Hugging Face ajoute le support de l'exécution des modèles GGUF dans transformers。
Raison de la recommandation
L'original expose la méthode d'intégration GGUF dans transformers et les écarts de débit avec llama.cpp, ce qui permet de juger si l'inférence locale peut passer sur les API existantes.
Source :Hugging Face Blog · huggingface.co