Mistral lance Agentic Search, une couche de récupération qui permet aux modèles de rechercher.
Motif de la recommandation :L'original détaille la boucle de récupération multi-étapes et les gains chiffrés sur FinanceBench et OfficeQA Pro, ce qui aide à juger l'écart avec le RAG one-shot.
Sentence Transformers v6.0 ajoute un quatrième type de modèle, MultiVectorEncoder。
Motif de la recommandation :Sentence Transformers v6.0 ajoute un quatrième type de modèle pour la recherche à interaction tardive, avec prise en charge des checkpoints PyLate et ColBERT et des modèles de documents visuels.
Health in ChatGPT permet désormais aux utilisateurs éligibles aux États-Unis de connecter en toute sécurité leurs dossiers médicaux et Apple Health afin d'obtenir des informations plus personnalisées et de mieux comprendre leur santé.
Motif de la recommandation :L'original expose l'ouverture de Health in ChatGPT à la connexion des dossiers médicaux et d'Apple Health, ce qui permet de juger de l'évolution des usages santé.
Google présente une version hébergée de Cross-Corpus Retrieval propulsée par Agentic RAG dans Gemini Enterprise Agent Platform。
Motif de la recommandation :L'article détaille l'architecture multi-agents et le mécanisme de contexte suffisant, avec des gains de précision mesurés sur FramesQA.
JetBrains publie Mellum2, un modèle Mixture-of-Experts de 12B paramètres entraîné de zéro sur le langage naturel et le code。
Motif de la recommandation :JetBrains publie un MoE 12B à 2,5B paramètres actifs sous Apache 2.0, avec des cas d'usage précis pour le routage, le RAG et les sous-agents.
Mistral AI publie en aperçu public Search Toolkit, un cadre composable et open source pour construire des pipelines de recherche destinés aux applications IA。
Motif de la recommandation :Un cadre unifié d'ingestion, de récupération et d'évaluation, open source et déployable sur site, qui permet de comparer les configurations de recherche sur ses propres données.
Hugging Face publie six nouveaux rerankers Sentence Transformers CrossEncoder, de 17M à 1B de paramètres。
Motif de la recommandation :Six rerankers de 17M à 1B, avec données et recette d'entraînement complètes, permettent d'évaluer le compromis qualité-latence d'un pipeline retrieve-then-rerank.
Sentence Transformers v5.4 permet d'encoder et de comparer textes, images, audio et vidéos via la même API。
Motif de la recommandation :La v5.4 de Sentence Transformers unifie texte, image, audio et vidéo dans une même API d'embedding et de reranking, avec la liste des modèles compatibles.
NVIDIA détaille un pipeline en six étapes pour transformer un modèle d'embedding généraliste (Llama-Nemotron-Embed-1B-v2) en modèle spécialisé à un domaine。
Motif de la recommandation :Présente un pipeline complet de fine-tuning d'embedding pour RAG, avec commandes, hyperparamètres et résultats mesurés sur un GPU unique.
Mistral annonce l'Agents API, un framework dédié qui combine ses modèles avec des connecteurs intégrés pour l'exécution de code。
Motif de la recommandation :L'annonce détaille les connecteurs intégrés, la mémoire persistante et l'orchestration multi-agents, avec des chiffres SimpleQA montrant l'apport de la recherche web.
Mistral AI annonce Mistral OCR, une API de reconnaissance optique de caractères qui traite images et PDF en entrée et restitue un contenu ordonné mêlant texte et images. Le modèle est présenté comme multilingue et multimodal, avec des benchmarks internes le plaçant devant Google Document AI, Azure OCR, Gemini-1.5 et GPT-4o sur les documents complexes, les mathématiques, le multilingue, les scans et les tableaux. L'API mistral-ocr-latest est facturée 1000 pages par dollar, avec environ le double de pages par dollar en inférence par lots, disponible sur la Plateforme et bientôt chez les partenaires cloud et en local, avec auto-hébergement sélectif pour les organisations traitant des informations sensibles.
Motif de la recommandation :L'original expose les performances comparées de Mistral OCR et son tarif à la page, utile pour évaluer son intégration dans un pipeline RAG documentaire.
OpenAI lance ChatGPT search, une fonctionnalité de recherche qui fournit des réponses rapides et actuelles accompagnées de liens vers des sources web pertinentes.
OpenAI teste SearchGPT, un prototype temporaire de nouvelles fonctionnalités de recherche qui fournit des réponses rapides et actuelles avec des sources claires et pertinentes.
Hugging Face présente la quantification des embeddings comme une étape de post-traitement qui réduit la mémoire et le stockage sans réduire la dimensionnalité. La quantification binaire convertit les valeurs float32 en 1 bit, soit une réduction de 32x, et permet de conserver environ 96 % des performances de retrieval grâce à une étape de rescoring avec l'embedding de requête float32 ; la quantification scalaire en int8 réduit la taille de 4x et atteint environ 99 % des performances avec un rescore_multiplier de 4 à 5. Sur un benchmark MTEB Retrieval, la quantification binaire offre un gain de vitesse moyen de 24,76x et la quantification int8 de 3,66x. Une démo combine recherche binaire et rescoring int8 sur 41 millions de textes Wikipédia, avec 5,2 Go de mémoire et 52 Go d'espace disque contre 200 Go pour un retrieval float32 classique. Le code est disponible via Sentence Transformers et des scripts d'exemple.
Motif de la recommandation :L'article détaille les principes et le code de la quantification binaire et scalaire des embeddings, avec des gains de vitesse et de coût mesurés sur 41 millions de textes.