Aller au contenu

OfficeQA Pro

Databricks / Travail professionnel · Chercher, calculer et répondre à partir d'un grand volume de documents financiers réels.

Évaluation officielle
dans le Actu Créaflash surEn observation
Budget de preuvesHors classement
Date des données amontÀ confirmer
Dernière synchronisation réussieCollecte non commencée

Ce qu'il mesure, comment il le mesure

Pro 133 questions figées, distinctes des 246 questions de Full et des 90 questions de Pro V2 ; la recherche de bout en bout et la fourniture directe de la page contenant la réponse relèvent de conditions différentes. Les scores de Claude Agent SDK, Codex SDK et Antigravity CLI appartiennent à leurs propres systèmes d'exécution et ne peuvent pas être mélangésen une évaluation unifiée du modèle de base. Elle mesure la compréhension de documents et ne représente pas la qualité de production des documents de bureau.

Comment utiliser ces preuves

En observation : les mises à jour officielles se poursuivent, mais la comparaison porte surtout sur différents systèmes d'exécution de produits et le protocole d'agrégation d'origine reste à vérifier ; on conserve la référence de compréhension des éléments, sans attribuer directement au modèle de base les scores de systèmes d'outils différents.

Limites de l'évaluation et attribution des données

Les licences du code et du corpus de questions ne couvrent pas automatiquement tous les scores externes ; anciens et nouveaux jeux de questions, conditions de bout en bout et de fourniture directe de la page de réponse ne peuvent pas être mélangés dans un même classement, et aucun score n'est actuellement collecté automatiquement.

Licence des données :Code Apache 2.0 ;Données des questions CC BY-SA 4.0, Désormais migré vers un jeu de données Hugging Face à accès sur demande.

Résultats publiés par Databricks ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.