Aller au contenu
10mois2jourvendredi
9mois28jourlundi
  1. Hugging Face Blog78

    H Company publie Holo4, une série de modèles agentiques pour l'usage informatique généraliste

    H Company publie la série Holo4, des modèles agentiques en deux tailles : 27B dense et 35B-A3B Mixture of Experts.

    Motif de la recommandation :Holo4 couvre GUI, code, MCP et API avec un même modèle, et les trajectoires des benchmarks sont ouvertes, ce qui permet de comparer le coût et les performances des agents computer-use.

9mois3jourjeudi
8mois10jourlundi
7mois15jourmercredi
  1. Hugging Face Blog88

    Thinking Machines Lab publie Inkling, un LLM multimodal open source de 1T paramètres avec fenêtre de contexte de 1M

    Thinking Machines Lab a publié sur Hugging Face Inkling, un grand modèle de langage multimodal open source d'environ 1T de paramètres (975B au total。

    Motif de la recommandation :L'article détaille l'architecture MoE, les variantes de quantification et le support d'inférence jour 0, ce qui aide à évaluer les besoins matériels et les options de déploiement.

6mois22jourlundi
6mois2jourmardi
5mois20jourmercredi
  1. Hugging Face Blog30

    OlmoEarth v1.1 : une famille plus efficace de modèles d'observation de la Terre

    Hugging Face publie OlmoEarth v1.1, une famille de modèles d'observation de la Terre qui réduit jusqu'à 3x les coûts de calcul tout en conservant les performances d'OlmoEarth v1. La réduction repose sur la fusion des tokens par résolution pour Sentinel-2, ce qui divise par trois le nombre de tokens, au prix d'une modification du pré-entraînement pour éviter une baisse de 10 points sur m-eurosat kNN. Les poids et le code d'entraînement des modèles Base, Tiny et Nano sont disponibles.

5mois19jourmardi
5mois15jourvendredi
4mois24jourvendredi
4mois9jourjeudi
4mois2jourjeudi
  1. Hugging Face Blog88

    Google DeepMind publie la famille Gemma 4 de modèles multimodaux ouverts sur Hugging Face

    Google DeepMind publie sur Hugging Face la famille Gemma 4, des modèles multimodaux sous licence Apache 2.0 capables de traiter texte。

    Motif de la recommandation :L'article détaille l'architecture, les tailles et les benchmarks de Gemma 4, ainsi que son intégration dans les principaux moteurs d'inférence et outils de fine-tuning.

4mois1jourmercredi
3mois31jourmardi
  1. Hugging Face Blog67

    IBM publie Granite 4.0 3B Vision, un VLM compact pour les documents d'entreprise

    IBM annonce Granite 4.0 3B Vision, un modèle vision-langage compact destiné à l'extraction d'informations dans les documents d'entreprise。

    Motif de la recommandation :Le modèle compact et son adaptateur LoRA sont décrits avec les benchmarks de tableaux, graphiques et KVP, ce qui aide à juger son intérêt pour l'extraction documentaire.

3mois17jourmardi
  1. Hugging Face Blog67

    H Company publie Holotron-12B, un modèle multimodal computer-use à haut débit

    H Company publie Holotron-12B, un modèle multimodal computer-use post-entraîné à partir du modèle ouvert NVIDIA Nemotron-Nano-2 VL sur des données propriétaires。

    Motif de la recommandation :L'article détaille l'architecture SSM hybride et les chiffres de débit, utiles pour évaluer le déploiement d'agents computer-use à grande échelle.

2mois4jourmercredi
1mois20jourmardi
  1. Hugging Face Blog78

    Overworld publie Waypoint-1, un modèle de diffusion vidéo interactif en temps réel

    Overworld publie Waypoint-1, un modèle de diffusion vidéo interactif en temps réel contrôlable à la souris。

    Motif de la recommandation :L'original expose l'architecture et les optimisations d'inférence d'un modèle de diffusion vidéo interactif, utile pour comprendre les compromis des world models temps réel.

1mois5jourlundi
12mois23jourmardi
  1. Hugging Face Blog62

    ServiceNow-AI publie AprielGuard, un modèle de garde-fou de 8B paramètres pour la sécurité des systèmes LLM

    ServiceNow-AI publie AprielGuard, un modèle de garde-fou de 8B paramètres conçu pour détecter 16 catégories de risques de sécurité ainsi que diverses attaques adversariales。

    Motif de la recommandation :Un modèle de garde-fou de 8B paramètres couvrant 16 catégories de risques et les attaques adversariales des workflows agentiques, avec les résultats d'évaluation détaillés.

11mois25jourmardi
9mois4jourjeudi
6mois3jourmardi
5mois15jourjeudi
3mois12jourmercredi
2mois21jourvendredi
2mois20jourjeudi
12mois19jourjeudi
12mois17jourmardi
12mois5jourjeudi
11mois26jourmardi
9mois25jourmercredi
8mois12jourlundi
  1. Hugging Face Blog78

    Falcon Mamba : le premier modèle 7B sans attention de TII

    Le Technology Innovation Institute (TII) d'Abu Dhabi publie Falcon Mamba 7B, présenté comme le premier grand modèle 7B sans attention。

    Motif de la recommandation :L'article détaille l'architecture sans attention, les benchmarks comparatifs et le support dans l'écosystème Hugging Face, utile pour évaluer les compromis des SSM.

7mois23jourmardi
7mois16jourmardi
  1. Mistral AI78

    Mistral AI publie Codestral Mamba, un modèle de code basé sur l'architecture Mamba

    Mistral AI publie Codestral Mamba, un modèle de code sous licence Apache 2.0 conçu avec Albert Gu et Tri Dao。

    Motif de la recommandation :Codestral Mamba adopte l'architecture Mamba avec une inférence en temps linéaire et un contexte testé jusqu'à 256k tokens, un point de repère pour évaluer les alternatives aux Transformer sur le code.

  2. Mistral AI62

    Mistral AI publie Mathstral, un modèle 7B spécialisé en mathématiques et STEM

    Mistral AI publie Mathstral, un modèle instructif 7B spécialisé dans les problèmes mathématiques et STEM à raisonnement logique multi-étapes。

    Motif de la recommandation :Mathstral 7B atteint 56,6 % sur MATH et 63,47 % sur MMLU, avec des gains supplémentaires via majority voting et reward model, ce qui éclaire les compromis performance/vitesse pour les modèles spécialisés.

6mois27jourjeudi
5mois24jourvendredi