Gemma 3n est désormais pleinement disponible dans l'écosystème open source
Gemma 3n est désormais pleinement disponible dans l'écosystème open source.
Orientations techniques
L'IA qui tourne sur smartphone, ordinateur et appareils en périphérie : progrès des petits modèles, de l'inférence locale et des puces embarquées.
31 sélections30 derniers jours 4 entréesTotal : 72 entrées
Gemma 3n est désormais pleinement disponible dans l'écosystème open source.
Falcon-Edge est une série de modèles de langage 1,58 bit présentés comme puissants, universels et fine-tunables.
Mistral AI annonce Mistral Small 3.1, présenté comme surpassant Gemma 3 et GPT-4o Mini avec une vitesse d'inférence de 150 tokens par seconde.
Motif de la recommandation :Mistral Small 3.1 précise les performances, la fenêtre de contexte et les points de disponibilité, ce qui permet de juger de son intérêt pour des déploiements légers.
Mistral AI publie Mistral Small 3, un modèle de 24 milliards de paramètres sous licence Apache 2.0.
Motif de la recommandation :Un modèle 24B sous Apache 2.0 qui rivalise avec des modèles trois fois plus grands et se déploie sur un seul GPU, avec les cas d'usage ciblés.
Hugging Face publie Transformers.js v3, qui ajoute le support WebGPU (jusqu'à 100x plus rapide que WASM).
Motif de la recommandation :L'annonce détaille le support WebGPU, les nouveaux formats de quantification et la compatibilité multi-runtimes, ce qui aide à évaluer l'exécution de modèles dans le navigateur.
Mistral AI annonce les Ministraux, deux modèles pour l'informatique embarquée et les cas d'usage en périphérie.
Motif de la recommandation :Mistral publie deux modèles edge sub-10B avec contexte 128k et tarifs API, ce qui éclaire les choix pour l'inférence locale et les workflows agentiques.
Google élargit la famille Gemma avec trois ajouts : Gemma 2 2B, la version 2,6 milliards de paramètres de Gemma 2 adaptée à une exécution sur appareil.
Motif de la recommandation :L'article détaille les trois ajouts de Google à la famille Gemma et fournit des exemples de code pour l'inférence locale et la génération assistée.
Hugging Face publie swift-transformers, un package Swift en développement qui implémente une API de type transformers pour la génération de texte.
Motif de la recommandation :Présente les outils et le guide de conversion Core ML pour exécuter Llama 2 sur Mac, avec les limites de performances et les optimisations prévues.
Hugging Face et Apple publient des modèles Core ML de Stable Diffusion XL, dont une version avec quantification mixed-bit réduisant l'UNet de 4.
Motif de la recommandation :Présente la quantification mixed-bit et des recettes prêtes à l'emploi pour exécuter Stable Diffusion XL sur Mac, avec des chiffres de taille et de latence.
Hugging Face présente les optimisations Core ML de WWDC'23 pour exécuter Stable Diffusion plus rapidement et avec moins de mémoire sur iPhone.
Motif de la recommandation :L'article détaille la quantification 6 bits de Core ML et fournit les commandes de conversion, permettant de reproduire le déploiement de Stable Diffusion sur appareil.
Grâce aux ingénieurs d'Apple, il est désormais possible d'exécuter Stable Diffusion sur Apple Silicon via Core ML. Le dépôt Apple fournit des scripts de conversion et du code d'inférence basés sur Diffusers, et les poids convertis des modèles Stable Diffusion v1.4, v1.5, v2 base et v2.1 base sont disponibles sur le Hugging Face Hub. Core ML prend en charge le CPU, le GPU et le Neural Engine, avec des variantes d'attention original et split_einsum ainsi que des formats packages pour Python et compilés pour Swift. Sur un MacBook Pro M1 Max avec macOS Ventura 13.1 Beta 4, la génération d'une image avec Stable Diffusion v1.4 a pris 18 secondes.
Motif de la recommandation :Le guide détaille les variantes de modèles Core ML et les commandes Python et Swift pour exécuter Stable Diffusion localement sur Apple Silicon.