Benchmark ouvert · Cognition sociale · Québec
Comprendre plus que les mots.
Nordet mesure la capacité des modèles à saisir l’intention, le contexte historique et les normes sociales propres à une culture minoritaire.
Le problème
La fluidité n’est pas la compréhension.
Un modèle peut sembler parfaitement à l’aise dans une langue tout en manquant ce qui est implicite : une intention qui diverge des mots, un registre déplacé ou une référence historique évidente pour la communauté qui la porte.
Ces angles morts sont plus fréquents lorsque la connaissance appartient à une culture minoritaire, à la langue parlée ou à une époque peu numérisée. Nordet rend cette perte de sens visible et mesurable.
Présentation
Nordet en quelques minutes.
Découvrez pourquoi nous avons créé ce benchmark, comment ses quatre tâches mesurent la cognition sociale et ce que les premiers résultats révèlent sur les modèles de pointe.
Regarder sur YouTubeLe benchmark
Quatre façons de manquer le contexte.
Chaque tâche combine une version challenge et un contrôle de même forme afin d’isoler la difficulté propre à la cognition sociale.
CFPQ · 110
Littéral vs intention
Inférer pourquoi une intervention est drôle ou quelle suite respecte réellement l’intention du locuteur dans une conversation spontanée.
Texte parléBAnQ + Wikipédia · 57
Inférence historique et sociale
Interpréter des scènes historiques à partir d’images dont le sens exige davantage qu’une reconnaissance visuelle de surface.
Image + texteDHFQ + Wikipédia · 106
Adaptation de la communication
Repérer un registre familier inapproprié ou prévenir un utilisateur qu’un texte reprend abusivement une œuvre existante.
Révision de texteDHFQ · 108
Compréhension culturelle
Retrouver le sens de mots québécois anciens ou familiers qui étaient courants il y a quelques générations, mais qui sont aujourd’hui rares.
Raisonnement lexicalMéthode
Le contrôle rend l’écart lisible.
Les contrôles utilisent la même forme de question et les mêmes critères de juge, mais demandent moins d’inférence culturelle. L’écart contrôle–challenge met ainsi en évidence ce qui rend le challenge difficile : comprendre l’implicite, l’intention sociale et un contexte culturel situé.
Résultats
Les meilleurs modèles parlent français, mais comprennent-ils le Québec?
Le classement complet compare six modèles de pointe. Gemini 3.1 Pro Preview arrive en tête, tandis que le plus grand écart challenge–contrôle apparaît sur l’interprétation historique et sociale.
Classement général
Mis à jour le 16 avril 2026Voir tous les résultats par tâche
| Model | Littéral vs intention | Inférence historique et sociale | Adaptation de la communication | Compréhension culturelle | ||||
|---|---|---|---|---|---|---|---|---|
| Ch. | Ctrl. | Ch. | Ctrl. | Ch. | Ctrl. | Ch. | Ctrl. | |
« À l’ère de l’intelligence artificielle, exister culturellement ne suffit plus. Il faut aussi exister dans les données. »
Source : La Presse — « Si l’IA apprend la culture, laquelle apprendra-t-elle? » ↗
Le projet
Créé au Québec, pour une IA culturellement plus attentive.
Toutes les questions ont été créées pour Nordet. Les réponses de référence sont ancrées dans des sources publiques de qualité et ne constituent pas des opinions de l’équipe.
Équipe
- David Nadeau, PhDOttawa, Canada
- Pascal SoucyQuébec, Canada
- Antoine LafranceMontréal, Canada
Données ouvertes