PRBench · Legal
Scale AI / Travail professionnel · Répond à des questions complexes issues du travail juridique réel, pour évaluer le jugement professionnel et la qualité de l'argumentation.
Ce qu'il mesure, comment il le mesure
Fige l'un des deux : Legal complet avec 500 questions ou Hard avec 250 ; outils de recherche, niveau de raisonnement et version des juges restent identiques. Utilise le score agrégé de la rubric de ce jeu de questions, sans compter deux fois l'ensemble complet et le sous-ensemble difficile, et sans présenter un questions-réponses spécialisé comme une livraison de fichiers complète.
Comment utiliser ces preuves
En observation : peut fournir des preuves de jugement juridique professionnel ; vérifier d'abord le jeu de questions, les conditions d'outils et le lot de scores ; pour l'instant, seule la source est référencée, sans collecte ni notation automatiques.
Limites de l'évaluation et attribution des données
Évalué par des juges modèles, avec un biais de jugement ; les benchmarks juridique et financier du même organisme doivent partager les mêmes limites d'influence et ne comptent pas comme deux preuves indépendantes. Il ne mesure pas directement la capacité à produire des fichiers Word, Excel ou diaporama.
Licence des données :La banque de questions et le code d'évaluation officiels sont publics ; leur licence ne couvre pas automatiquement les scores du classement en temps réel, et l'export stable des derniers scores ainsi que les limites de réaffichage restent à confirmer.
Résultats publiés par Scale AI ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.