Aller au contenu

Orientations techniques

Données et entraînement Dernières actualités

Les dessous de l'entraînement : construction de jeux de données, données synthétiques, méthodes de pré-entraînement et de post-entraînement, puissance de calcul et coûts d'entraînement.

124 sélections30 derniers jours 8 entréesTotal : 372 entrées

mise à jour

Archives de la sélection · page 3

4mois22jourmercredi41–60 entrées
  1. OpenAI News62

    OpenAI publie Privacy Filter, un modèle à poids ouverts pour détecter et masquer les données personnelles

    OpenAI publie Privacy Filter, un modèle à poids ouverts destiné à détecter et masquer les informations personnelles identifiables (PII) dans du texte, avec une précision annoncée comme état de l'art.

    Motif de la recommandation :Un modèle à poids ouverts d'OpenAI dédié à la détection et à la suppression des données personnelles, avec un point d'entrée concret pour les flux de traitement de texte.

4mois16jourjeudi
  1. Google Research60

    Google Research présente Simula, un cadre de génération de données synthétiques piloté par le raisonnement

    Google Research présente Simula, un cadre de génération de données synthétiques sans seed qui construit des jeux de données à partir de principes premiers via la conception de mécanismes. Le système décompose la génération en quatre axes contrôlables : diversification globale par taxonomies hiérarchiques, diversification locale par méta-prompts, complexification configurable et contrôle qualité par boucle à double critique. Évalué avec Gemini 2.5 Flash comme modèle enseignant et Gemma-3 4B comme élève sur cinq domaines (cybersécurité, raisonnement juridique, GSM8k, Global MMLU), il génère jusqu'à 512K points par domaine ; une complexité élevée apporte un gain de 10 % en mathématiques mais nuit au raisonnement juridique. Simula alimente l'écosystème Gemma (ShieldGemma, FunctionGemma, MedGemma) et des fonctions de protection des utilisateurs comme la détection d'arnaques sur Android et le filtrage de spam dans Google Messages.

    Motif de la recommandation :L'article expose une méthode de génération de données synthétiques pilotée par le raisonnement et ses résultats sur cinq domaines, utile pour comprendre comment couvrir des cas rares sans données réelles.

  2. Google Research60

    Google Research présente MoGen, des neurones synthétiques pour accélérer la cartographie cérébrale

    Google Research présente MoGen, un modèle de génération de morphologies neuronales par point cloud flow matching。

    Motif de la recommandation :L'article détaille comment des neurones synthétiques générés par IA réduisent les erreurs de reconstruction et le temps de relecture manuelle, avec des chiffres concrets.

  3. OpenAI News82

    OpenAI lance GPT-Rosalind, un modèle de raisonnement pour la recherche en sciences de la vie

    OpenAI présente GPT-Rosalind, un modèle de raisonnement de pointe conçu pour accélérer la découverte de médicaments。

    Motif de la recommandation :Un nouveau modèle de raisonnement d'OpenAI orienté sciences de la vie, dont les capacités annoncées couvrent la découverte de médicaments et l'analyse génomique.

4mois14jourmardi
  1. Google Research60

    Google Research présente Vantage, une expérience d'évaluation des compétences durables par l'IA générative

    Google Research présente Vantage, une expérience de recherche qui évalue les compétences durables des élèves en les plaçant dans des conversations simulées avec des avatars IA. Un Executive LLM pilote le dialogue pour susciter des occasions de démontrer des compétences comme la résolution de conflits ou la gestion de projet, puis un AI Evaluator note la conversation selon une grille d'évaluation. Une étude conjointe avec la New York University menée auprès de 188 testeurs de 18 à 25 ans indique que l'accord entre l'AI Evaluator et les experts humains est comparable à celui entre deux évaluateurs experts. Vantage est disponible en anglais sur Google Labs.

    Motif de la recommandation :L'article détaille un dispositif d'évaluation des compétences durables par des avatars IA pilotés par un Executive LLM, avec validation par des experts humains.

3mois31jourmardi
  1. Hugging Face Blog67

    IBM publie Granite 4.0 3B Vision, un VLM compact pour les documents d'entreprise

    IBM annonce Granite 4.0 3B Vision, un modèle vision-langage compact destiné à l'extraction d'informations dans les documents d'entreprise。

    Motif de la recommandation :Le modèle compact et son adaptateur LoRA sont décrits avec les benchmarks de tableaux, graphiques et KVP, ce qui aide à juger son intérêt pour l'extraction documentaire.

  2. Google Research75

    Google Quantum AI publie un livre blanc sur la vulnérabilité quantique des cryptomonnaies

    Google Quantum AI a publié un livre blanc montrant que de futurs ordinateurs quantiques pourraient casser la cryptographie à courbes elliptiques protégeant les cryptomonnaies avec moins de qubits et de portes que estimé auparavant. Les circuits compilés pour l'algorithme de Shor sur ECDLP-256 utilisent moins de 1 200 qubits logiques et 90 millions de portes Toffoli, ou moins de 1 450 qubits logiques et 70 millions de portes Toffoli, exécutables en quelques minutes sur un CRQC supraconducteur de moins de 500 000 qubits physiques, soit une réduction d'environ 20 fois du nombre de qubits physiques nécessaires. Google recommande la transition des blockchains vers la cryptographie post-quantique (PQC) et a développé une preuve à divulgation nulle de connaissance pour permettre la vérification des vulnérabilités sans fournir de feuille de route aux acteurs malveillants, en collaboration avec le gouvernement américain et selon une échéance 2029.

    Motif de la recommandation :Google Quantum AI détaille les ressources quantiques nécessaires pour casser ECDLP-256 et propose une divulgation par preuve à divulgation nulle de connaissance.

3mois25jourmercredi
  1. Google Research67

    Google Research 发布 TurboQuant 等三种向量量化算法, 将 KV cache 压缩至 3 bit

    Google Research 发布 TurboQuant 压缩算法, 并配套提出 QJL 与 PolarQuant, 三者将收录于 ICLR 2026 和 AISTATS 2026. TurboQuant 无需训练或微调即可把 KV cache 量化到 3 bit。

    Motif de la recommandation :Google Research 公开 TurboQuant 等三种向量量化算法, 可在不损失精度的前提下把 KV cache 压到 3 bit, 并给出长上下文基准与向量检索的实测数据.

3mois21joursamedi
  1. Hugging Face Blog78

    Construire un modèle d'embedding spécialisé en moins d'une journée

    NVIDIA détaille un pipeline en six étapes pour transformer un modèle d'embedding généraliste (Llama-Nemotron-Embed-1B-v2) en modèle spécialisé à un domaine。

    Motif de la recommandation :Présente un pipeline complet de fine-tuning d'embedding pour RAG, avec commandes, hyperparamètres et résultats mesurés sur un GPU unique.

3mois18jourmercredi
  1. Google Research76

    Google Research 与 NHS 合作研究 :AI 乳腺筛查可减少 46% 人工阅片量

    Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项研究, 评估 AI 乳腺筛查系统. 第一项研究对 125。

    Motif de la recommandation :通过 NHS 多中心前瞻部署与阅片者研究, 给出 AI 乳腺筛查在真实工作流中的灵敏度, 时间与工作量数据.

  2. Mistral AI62

    Mistral AI lance Forge, un système pour entraîner des modèles d'IA sur les connaissances internes des entreprises

    Mistral AI a annoncé Forge, un système destiné aux entreprises pour construire des modèles d'IA de niveau frontière ancrés dans leurs connaissances propriétaires. Forge prend en charge le pré-entraînement, le post-entraînement et l'apprentissage par renforcement sur des documents internes, des bases de code et des données opérationnelles, avec des architectures denses et MoE ainsi que des entrées multimodales. Mistral AI indique avoir déjà collaboré avec ASML, DSO National Laboratories Singapore, Ericsson, l'Agence spatiale européenne, HTX Singapore et Reply. Le système est conçu pour les agents de codage comme Mistral Vibe, qui peuvent l'utiliser pour affiner des modèles, trouver des hyperparamètres optimaux et générer des données synthétiques.

    Motif de la recommandation :Mistral AI présente Forge, un système permettant aux entreprises d'entraîner des modèles sur leurs données internes, avec prise en charge des architectures denses et MoE et des agents autonomes.

3mois12jourjeudi
  1. Google Research76

    Google Research présente Groundsource, qui transforme les articles de presse en données avec Gemini

    Google Research présente Groundsource, une méthodologie qui utilise Gemini pour transformer des articles de presse non structurés en données historiques exploitables. Le premier jeu de données open access porte sur les crues soudaines urbaines et contient 2,6 millions d'événements couvrant plus de 150 pays depuis 2000. Lors de vérifications manuelles, 60 % des événements extraits étaient exacts en lieu et date, et 82 % suffisamment précis pour une analyse pratique. Groundsource a capturé entre 85 % et 100 % des événements de crue sévère enregistrés par GDACS entre 2020 et 2026. Ces données permettent des prévisions de crues soudaines urbaines jusqu'à 24 heures à l'avance, désormais déployées dans Google Flood Hub.

    Motif de la recommandation :L'article détaille une méthode d'extraction de données historiques à partir d'articles de presse avec Gemini et fournit des chiffres de validation concrets.

  2. Google Research78

    Google Research publie une étude clinique sur l'IA de diagnostic conversationnel AMIE

    Google Research publie les résultats d'une étude de faisabilité prospective menée avec le Beth Israel Deaconess Medical Center。

    Motif de la recommandation :L'étude détaille le déploiement réel d'AMIE en soins primaires, avec des chiffres de sécurité et de précision diagnostique qui éclairent les limites d'un agent conversationnel médical.

3mois10jourmardi
3mois7joursamedi
  1. Google Research62

    Google Research publie WAXAL, un corpus vocal ouvert pour 27 langues africaines

    Google Research présente WAXAL, un corpus vocal ouvert couvrant 27 langues d'Afrique subsaharienne parlées par plus de 100 millions de locuteurs dans plus de 26 pays. La publication inclut environ 1 846 heures d'audio transcrit pour la reconnaissance automatique de la parole (ASR) et plus de 565 heures d'enregistrements haute fidélité pour la synthèse vocale (TTS), sous licence CC-BY-4.0. Le projet, mené depuis 2021 avec des universités et organisations communautaires africaines, vise à soutenir la recherche et le développement de technologies vocales inclusives.

    Motif de la recommandation :L'article détaille la composition et les licences d'un corpus vocal multilingue, utile pour évaluer la couverture des langues à faibles ressources.

3mois4jourmercredi
2mois18jourmercredi
  1. Google Research60

    Google Research présente MapTrace, un pipeline de données synthétiques pour apprendre aux MLLM à tracer des itinéraires sur des cartes

    Google Research présente MapTrace, une nouvelle tâche。

    Motif de la recommandation :L'article détaille un pipeline de génération de données synthétiques pour l'apprentissage du tracé d'itinéraires sur cartes, avec des résultats chiffrés sur MapBench.

2mois13jourvendredi