Motif de la recommandation :Microsoft Research présente Quine, un modèle mondial multimodal de biologie couplé à un harnais, avec une validation en laboratoire humide sur le cancer du pancréas.
Motif de la recommandation :L'original détaille les capacités visuelles temps réel, l'exécution asynchrone d'outils et la prise en charge de 97 langues, ce qui aide à évaluer l'usage en entreprise.
Google DeepMind annonce Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS, deux modèles de synthèse vocale générative disponibles dans Google AI Studio.
Motif de la recommandation :Google DeepMind détaille les capacités vocales et les garde-fous des deux modèles TTS, utile pour évaluer les usages en doublage et agents vocaux.
Motif de la recommandation :Les deux modèles de dialogue en temps réel de Google DeepMind sont présentés avec leurs scores sur plusieurs benchmarks vocaux et agentiques, ce qui permet de situer leurs capacités et leur positionnement prix.
Motif de la recommandation :L'original expose les compromis efficacité-performance et les estimations de temps GPU, ce qui permet de juger si l'analyse à grande échelle devient réalisable.
Motif de la recommandation :L'original indique les scénarios ciblés par les deux petites versions de GPT-5.4, utile pour évaluer le choix de modèle pour les charges API à haut volume.
Descript s'appuie sur les modèles de raisonnement d'OpenAI pour automatiser la localisation de vastes bibliothèques de contenus sans perdre le timing ni le sens. L'ingénierie décrite permet un doublage multilingue à grande échelle des vidéos.
Motif de la recommandation :OpenAI publie un modèle vocal speech-to-speech plus avancé et étend la Realtime API au support MCP, à l'entrée d'images et à la téléphonie SIP.
OpenAI présente GPT-5, son meilleur système d'IA à ce jour. Selon OpenAI, GPT-5 marque un bond important en intelligence par rapport à tous ses modèles précédents。
Invideo AI s'appuie sur GPT-4.1, gpt-image-1 et les modèles de synthèse vocale d'OpenAI pour transformer des idées créatives en vidéos professionnelles en quelques minutes。
OpenAI publie la fiche système d'o3 et o4-mini. Selon la présentation, ces deux modèles combinent un raisonnement de pointe avec l'ensemble des capacités d'outils 。
Motif de la recommandation :La fiche système d'o3 et o4-mini expose l'intégration du raisonnement et des outils, un point de repère pour évaluer les capacités des modèles.
OpenAI lance o1, ainsi que des améliorations de la Realtime API, une nouvelle méthode de fine-tuning et d'autres nouveautés destinées aux développeurs.
Le fine-tuning de vision de GPT-4o permet de construire des cartes plus intelligentes. Cette approche exploite les capacités de vision du modèle pour améliorer la compréhension et le traitement des données cartographiques.
Motif de la recommandation :L'API de fine-tuning de GPT-4o prend désormais en charge les images et le texte, ce qui permet aux développeurs d'ajuster directement les capacités de vision.
OpenAI annonce au DevDay GPT-4 Turbo avec une fenêtre de contexte de 128K et des prix réduits, la nouvelle Assistants API, GPT-4 Turbo with Vision et l'API DALL·E 3, entre autres.
Motif de la recommandation :Récapitulatif des nouveautés annoncées au DevDay, utile pour situer les changements de modèles et d'API destinés aux développeurs.
OpenAI a créé GPT-4, un grand modèle multimodal qui accepte les entrées d'images et de texte et produit des sorties textuelles. OpenAI indique qu'il est moins capable que les humains dans de nombreux scénarios réels, mais qu'il atteint des performances de niveau humain sur divers benchmarks professionnels et académiques.
Motif de la recommandation :L'annonce présente les entrées multimodales de GPT-4 et ses performances de niveau humain sur plusieurs benchmarks professionnels et académiques.
Motif de la recommandation :L'article explique comment les neurones multimodaux de CLIP répondent à un même concept sous différentes formes, ce qui aide à comprendre les biais du modèle.
OpenAI présente CLIP, un réseau de neurones qui apprend efficacement des concepts visuels à partir d'une supervision en langage naturel. CLIP peut être appliqué à n'importe quel benchmark de classification visuelle en fournissant simplement les noms des catégories à reconnaître, à la manière des capacités zero-shot de GPT-2 et GPT-3.
Motif de la recommandation :Présente la génération de musique en audio brut et la mise à disposition des poids et du code, utile pour comprendre les capacités des modèles génératifs audio.