Benchmark ouvert · Cognition sociale · Québec

Comprendre plus que les mots.

Nordet mesure la capacité des modèles à saisir l’intention, le contexte historique et les normes sociales propres à une culture minoritaire.

Le problème

La fluidité n’est pas la compréhension.

Un modèle peut sembler parfaitement à l’aise dans une langue tout en manquant ce qui est implicite : une intention qui diverge des mots, un registre déplacé ou une référence historique évidente pour la communauté qui la porte.

Ces angles morts sont plus fréquents lorsque la connaissance appartient à une culture minoritaire, à la langue parlée ou à une époque peu numérisée. Nordet rend cette perte de sens visible et mesurable.

Présentation

Nordet en quelques minutes.

Découvrez pourquoi nous avons créé ce benchmark, comment ses quatre tâches mesurent la cognition sociale et ce que les premiers résultats révèlent sur les modèles de pointe.

Regarder sur YouTube
381questions originales
4dimensions sociales
57questions avec image
FR · ENbenchmark bilingue

Le benchmark

Quatre façons de manquer le contexte.

Chaque tâche combine une version challenge et un contrôle de même forme afin d’isoler la difficulté propre à la cognition sociale.

01

CFPQ · 110

Littéral vs intention

Inférer pourquoi une intervention est drôle ou quelle suite respecte réellement l’intention du locuteur dans une conversation spontanée.

Texte parlé
02

BAnQ + Wikipédia · 57

Inférence historique et sociale

Interpréter des scènes historiques à partir d’images dont le sens exige davantage qu’une reconnaissance visuelle de surface.

Image + texte
03

DHFQ + Wikipédia · 106

Adaptation de la communication

Repérer un registre familier inapproprié ou prévenir un utilisateur qu’un texte reprend abusivement une œuvre existante.

Révision de texte
04

DHFQ · 108

Compréhension culturelle

Retrouver le sens de mots québécois anciens ou familiers qui étaient courants il y a quelques générations, mais qui sont aujourd’hui rares.

Raisonnement lexical

Méthode

Le contrôle rend l’écart lisible.

Les contrôles utilisent la même forme de question et les mêmes critères de juge, mais demandent moins d’inférence culturelle. L’écart contrôle–challenge met ainsi en évidence ce qui rend le challenge difficile : comprendre l’implicite, l’intention sociale et un contexte culturel situé.

Contrôle0,97
Δ0,23
Challenge0,74

Résultats

Les meilleurs modèles parlent français, mais comprennent-ils le Québec?

Le classement complet compare six modèles de pointe. Gemini 3.1 Pro Preview arrive en tête, tandis que le plus grand écart challenge–contrôle apparaît sur l’interprétation historique et sociale.

Classement général

Mis à jour le 16 avril 2026
Voir tous les résultats par tâche
Model Littéral vs intention Inférence historique et sociale Adaptation de la communication Compréhension culturelle
Ch.Ctrl.Ch.Ctrl. Ch.Ctrl.Ch.Ctrl.
« À l’ère de l’intelligence artificielle, exister culturellement ne suffit plus. Il faut aussi exister dans les données. »

Source : La Presse — « Si l’IA apprend la culture, laquelle apprendra-t-elle? » ↗

Le projet

Créé au Québec, pour une IA culturellement plus attentive.

Toutes les questions ont été créées pour Nordet. Les réponses de référence sont ancrées dans des sources publiques de qualité et ne constituent pas des opinions de l’équipe.

Équipe

  • David Nadeau, PhDOttawa, Canada
  • Pascal SoucyQuébec, Canada
  • Antoine LafranceMontréal, Canada

Sources

Données ouvertes

Faites passer vos modèles dans le nordet.

Explorer le dataset