>_ PresidentBench
PresidentBench est un dispositif d’évaluation destiné aux modèles de langage. Il mesure leurs capacités dans des contextes simulés, sans référence à un standard externe. Son objet porte sur la performance stratégique de ces systèmes.
Concrètement, PresidentBench soumet les modèles à des scénarios de raisonnement stratégique. Les résultats obtenus indiquent une faiblesse dans ce domaine, ainsi que des divergences dans les alignements géopolitiques des modèles testés. Ces constats émergent de l’analyse des comportements simulés, sans extrapolation sur leurs causes.
Ce dispositif s’inscrit dans une chaîne d’évaluation reliant plusieurs entités. Il évalue les « Modèles de langage » (Concept), dont il constitue un outil de mesure. En retour, il est lui-même évalué par le « Modele Chinois » (Concept), qui l’utilise comme référence. Ses résultats nourrissent les analyses présentées dans l’article « Le Golem joue à Civilization, et il ne voit pas venir le troisième joueur — Cassandria », qui traite des évaluations d’IA pour la sécurité nationale et confirme les limites stratégiques observées.