NVIDIA annonce une configuration 64GB de son DGX Spark, disponible ce mois-ci chez Acer.
Motif de la recommandation :La configuration 64GB et le cluster à deux nœuds précisent le budget mémoire, le prix et les cas d'usage des agents locaux.
Florian Euchner a publié ESP-SDR sur GitHub, un firmware qui transforme la radio Wi-Fi 2。
Motif de la recommandation :Un firmware open source transforme la radio Wi-Fi de l'ESP32 en SDR sans matériel dédié, avec les limites de calibration documentées.
Cactus Compute présente Needle 2, un modèle de function calling de 14 Mo qui transforme des instructions en anglais en actions locales sur un Raspberry Pi 5.
Motif de la recommandation :Un exemple concret de modèle de function calling de 14 Mo exécuté en local sur Raspberry Pi 5, avec latences et consommation mémoire mesurées.
Hugging Face ajoute le support de l'exécution des modèles GGUF dans transformers。
Motif de la recommandation :L'original expose la méthode d'intégration GGUF dans transformers et les écarts de débit avec llama.cpp, ce qui permet de juger si l'inférence locale peut passer sur les API existantes.
Hugging Face publie @huggingface/kernels, une bibliothèque JavaScript minimale permettant de charger et exécuter des kernels WebGPU optimisés depuis le Hub。
Motif de la recommandation :Présente la bibliothèque de chargement, la structure des dépôts de kernels et les données comparatives face à ORT WebGPU, utile pour évaluer l'inférence locale dans le navigateur.
Liquid AI publie les points de contrôle DSpark draft pour trois modèles de la famille LFM2.5 。
Motif de la recommandation :Liquid AI publie les points de contrôle DSpark pour trois modèles LFM2.5, avec des chiffres de gain de débit sur H100 et MacBook et un support llama.cpp et SGLang dès le premier jour.
Google DeepMind présente SL2T, un modèle de traduction de la langue des signes vers le texte (SL2T) massivement multilingue。
Motif de la recommandation :Le modèle SL2T de Google DeepMind est déployé dans Gboard et Live Transcribe sur Pixel 11, avec des détails sur l'entraînement et la protection de la vie privée.
Health in ChatGPT permet désormais aux utilisateurs éligibles aux États-Unis de connecter en toute sécurité leurs dossiers médicaux et Apple Health afin d'obtenir des informations plus personnalisées et de mieux comprendre leur santé.
Motif de la recommandation :L'original expose l'ouverture de Health in ChatGPT à la connexion des dossiers médicaux et d'Apple Health, ce qui permet de juger de l'évolution des usages santé.
Google Research présente une architecture qui greffe la prédiction multi-token (MTP) sur des modèles Gemini Nano v3 gelés。
Motif de la recommandation :L'article détaille comment greffer la prédiction multi-token sur un Gemini Nano v3 gelé, avec une architecture zéro copie et des gains mesurés sur Pixel.
Google DeepMind publie DiffusionGemma, un modèle expérimental open source sous licence Apache 2.0 qui génère le texte par diffusion plutôt que token par token。
Motif de la recommandation :Un modèle expérimental open source qui échange la qualité contre la vitesse d'inférence locale, avec des compromis clairement exposés.
Google DeepMind publie Gemma 4 12B, un modèle multimodal conçu pour apporter l'intelligence agentique directement sur les ordinateurs portables。
Motif de la recommandation :L'architecture sans encodeur et l'exécution locale sur 16 Go de VRAM permettent de juger de l'impact sur les déploiements embarqués.
Google Research présente PHRM, un système de recherche qui utilise la caméra frontale du smartphone pour capturer des vidéos du visage après le déverrouillage et estime la fréquence cardiaque par photopléthysmographie à distance et apprentissage profond, avec une MAPE inférieure à 10 % par rapport à l'électrocardiogramme. Le système agrège les mesures de la journée pour estimer la fréquence cardiaque au repos quotidienne, avec une MAE inférieure à 5 bpm par rapport aux objets portables. L'étude s'appuie sur plus de 350 000 clips vidéo de près de 700 participants, en veillant à la représentation des différents tons de peau, et publie le plus grand ensemble de données vidéo de smartphone disponible pour la recherche ainsi qu'un modèle pré-entraîné PHRM-mini.
Motif de la recommandation :Le système PHRM utilise la caméra frontale du téléphone pour surveiller en arrière-plan la fréquence cardiaque et la fréquence cardiaque au repos, avec une précision proche de celle des objets portables, et publie le plus grand ensemble de données diversifié à ce jour.
H Company publie la famille Holo3.1, une mise à jour de son modèle computer-use Holo3。
Motif de la recommandation :La famille Holo3.1 expose les gains sur AndroidWorld et les checkpoints quantifiés pour l'inférence locale, ce qui aide à évaluer le déploiement d'agents computer-use.
Hugging Face détaille comment faire tourner entièrement en local la conversation vocale de Reachy Mini。
Motif de la recommandation :Guide pas à pas pour exécuter localement toute la chaîne vocale de Reachy Mini, avec composants recommandés et options de déploiement interchangeables.
Overworld publie Waypoint-1.5, son nouveau modèle de monde vidéo temps réel。
Motif de la recommandation :L'original expose les paliers de résolution, la plage matérielle et les modes d'exécution locale, ce qui permet de juger de l'accessibilité réelle du modèle.
Google DeepMind annonce Gemma 4, sa famille de modèles ouverts la plus intelligente à ce jour。
Motif de la recommandation :L'original détaille les quatre tailles de Gemma 4, la licence Apache 2.0 et les performances comparées sur Arena, ce qui permet de juger de son intérêt pour le déploiement local et l'edge.
Hugging Face annonce que GGML, créateur de llama.cpp。
Motif de la recommandation :L'annonce précise le maintien de l'autonomie de llama.cpp et les axes d'intégration avec transformers, utile pour suivre l'évolution de l'inférence locale.
Transformers.js v4 est disponible sur NPM après un an de développement. La version adopte un nouveau runtime WebGPU réécrit en C++ avec l'équipe ONNX Runtime。
Motif de la recommandation :Transformers.js v4 détaille le nouveau runtime WebGPU en C++, les gains de performance et la restructuration du dépôt, utile pour évaluer le déploiement d'inférence dans le navigateur.
Google Research présente provably private insights (PPI), un système qui combine LLM。
Motif de la recommandation :Présente un système combinant LLM, confidentialité différentielle et TEE pour analyser l'usage des outils GenAI sans exposer les données individuelles, avec code open source.
Google Research annonce le déploiement d'un aperçu public optionnel du coach santé personnel pour les utilisateurs Fitbit Premium Android aux États-Unis。
Motif de la recommandation :L'article détaille l'architecture multi-agents et le cadre d'évaluation SHARP derrière le coach santé Gemini, utile pour comprendre comment un assistant grand public est construit et validé.