Il y a quelques mois, j’ai assisté à une réunion de bilan de recrutement au cours de laquelle un score de présélection par IA avait été le facteur décisif dans l’offre faite à un candidat. Le candidat avait obtenu un score bien supérieur au seuil, l’équipe était satisfaite et le poste avait été pourvu deux jours plus rapidement que la moyenne.
Six semaines plus tard, cette personne avait quitté l’entreprise.
Personne dans la salle n’a pu me dire si le score avait déjà été vérifié par rapport à un résultat réel — positif ou négatif. Il avait simplement été considéré comme fiable, comme on fait confiance à un thermomètre sans jamais demander qui l’a étalonné.
C’est la raison d’être de Screenz, et la raison d’être de cet article.
Si vous évaluez des outils de présélection par IA, vous avez vu les chiffres de précision mis en avant par les fournisseurs — 89 % par-ci, 94 % par-là, « surpasse l’examen manuel ». Ces chiffres sont généralement vrais. Mais ils répondent aussi généralement à une question différente de celle que vous vous posez réellement.
Ce que signifie généralement la « précision » (et ce que Screenz mesure à la place)
La plupart des affirmations des fournisseurs d’outils de présélection par IA concernant la précision décrivent dans quelle mesure l’outil fait correspondre un CV ou un profil à une description de poste — en identifiant les compétences, les intitulés de poste et les années d’expérience, puis en classant les candidats selon les critères énoncés. C’est réel, mesurable et véritablement utile. Mais ce n’est pas la même chose que prédire comment une personne se comportera réellement une fois recrutée.
Il s’agit de deux questions différentes :
- Précision de la correspondance : Le profil de ce candidat ressemble-t-il à ce que nous avons dit rechercher ?
- Validité prédictive : Un score élevé est-il réellement corrélé à de bonnes performances ou à une plus longue ancienneté une fois la personne en poste ?

Un outil peut être excellent sur le premier point et totalement non validé sur le second. La plupart des communications marketing des fournisseurs ne font pas la distinction entre les deux, et la plupart des acheteurs ne savent pas qu’ils doivent poser la question — c’est exactement ainsi qu’un score bien présenté finit par être considéré comme parole d’évangile lors d’une réunion de bilan de recrutement.
Chez Screenz, nous considérons qu’il s’agit de deux chiffres distincts, et non d’un score combiné — car les confondre est précisément ce qui permet de présenter un outil de correspondance comme un outil prédictif.
La question à laquelle nous avons conçu Screenz pour répondre
La recherche lui donne un nom : la validité prédictive — la corrélation entre le score obtenu à une évaluation et une mesure indépendante ultérieure de la performance, comme les évaluations des responsables, la production ou la rétention à 12 mois. Elle est évaluée sur une échelle allant de 0 (aucune relation) à 1 (prédiction parfaite) et, dans le monde réel, rien de ce qui concerne le recrutement n’approche 1.

Pour donner un point de comparaison, les recherches méta-analytiques sur les entretiens structurés — le parent le plus proche et le mieux étudié des agents d’entretien par IA actuels — situent généralement les coefficients de validité entre 0,28 et 0,30, selon la dimension de la performance mesurée. Ces chiffres reflètent des décennies de perfectionnement et sont considérés comme un résultat solide dans la sélection du personnel. Ils sont très loin de ce que laisse entendre un chiffre annoncé comme « précis à 94 % » pour un acheteur qui ne maîtrise pas la différence — et ils représentent un seuil nettement plus exigeant que celui auquel la plupart des fournisseurs de solutions de présélection par IA acceptent de se soumettre.
C’est exactement la question à laquelle nous avons conçu la couche d’intelligence de Screenz pour continuer à répondre. Chaque candidat passe le même entretien structuré et spécifique au poste. Les candidats sont ensuite classés selon ces critères, avec la transcription et le raisonnement à l’appui, afin qu’un évaluateur puisse vérifier le travail du modèle plutôt que d’accepter le score sans réserve. Une fois la personne recrutée, nous suivons les signaux de suivi et de rétention en les comparant à ce que l’entretien avait indiqué à son sujet — puis nous réinjectons ces tendances dans le classement de la prochaine présélection. Cette boucle est tout l’intérêt du système : la validité n’est pas une affirmation que nous formulons une seule fois au lancement, c’est un élément que le système réévalue continuellement à partir des résultats au fur et à mesure qu’ils se manifestent.

Alors, lorsqu’un fournisseur affirme que son outil prédit la performance, une question permet d’aller droit au but :
« Validé par rapport à quel résultat, mesuré comment et sur quelle période ? »
Si la réponse honnête est « nous ne l’avons pas encore mesuré », cela ne signifie pas automatiquement que l’outil doit être écarté — cela signifie simplement que vous achetez un outil de correspondance, et non un outil prédictif, et que votre confiance dans le score lors des décisions serrées doit être ajustée en conséquence.
Trois questions à poser avant de faire confiance à un score (Screenz compris)
- Par rapport à quel résultat la validité a-t-elle été établie — et combien de temps après le recrutement ?
« Prédit la réussite » peut désigner un indicateur de performance à 30 jours, un taux de rétention à 12 mois ou une évaluation intuitive d’un responsable. Demandez laquelle, et demandez comment la « réussite » a été définie avant le début de l’étude — et non après, lorsqu’il est facile de choisir la mesure qui donne au résultat la meilleure apparence.
- Validé sur des données similaires aux vôtres, ou emprunté à un autre contexte ?
Une étude de validité menée sur l’ensemble plus large de la clientèle d’un fournisseur ne s’applique pas automatiquement à vos postes, à votre secteur ou à votre marché du travail. Demandez si les éléments probants incluent quoi que ce soit qui ressemble à votre contexte — et si le fournisseur propose un moyen de valider l’outil par rapport à vos propres données de résultats de manière continue, et pas seulement au stade de la vente.

- Quel est le ratio d’impact défavorable, et qui l’a vérifié ?
Selon la règle des quatre cinquièmes, largement utilisée, le taux de sélection d’un groupe qui tombe sous les 80 % du taux du groupe obtenant les meilleurs scores mérite d’être examiné. Un outil peut avoir une validité prédictive convenable tout en entraînant un impact disproportionné — ce sont deux questions distinctes, et un fournisseur qui ne peut répondre qu’à l’une n’a en réalité répondu à aucune.
Pour nous, ce ne sont pas des hypothèses. Ce sont les trois questions auxquelles l’Intelligence Layer est conçue pour continuer à répondre — non pas une seule fois au lancement, mais de manière continue, à mesure que de nouvelles données de résultats arrivent.
Rien de tout cela ne consiste à remettre en question l’IA en tant que catégorie. Il s’agit de faire la différence entre un fournisseur qui vous dit que son score fonctionne et un fournisseur qui vous montre les éléments probants démontrant qu’il fonctionne — pour les résultats qui comptent pour votre entreprise, et pas seulement pour ceux qu’il est facile de mettre en avant.
Pourquoi nous avons conçu Screenz autour de cette question
Je vais être franc : cette liste n’est pas neutre. Nous avons conçu Screenz autour d’un agent d’IA qui mène des entretiens structurés — et non d’un agent qui se contente d’analyser un CV — ce qui signifie que la question de la validité prédictive n’est pas abstraite pour nous. C’est tout le produit. L’efficacité est facile à démontrer et à commercialiser : des listes restreintes plus rapides, un coût par recrutement plus faible. La validité des résultats est plus difficile à construire et plus longue à démontrer, ce qui explique probablement pourquoi moins de fournisseurs la mettent en avant.
Nous préférerions être jugés sur la question la plus difficile. Si vous nous demandez « validé par rapport à quoi ? », nous voulons que ce soit la partie la plus simple de la conversation — et non celle qui est réorientée vers une démonstration des fonctionnalités.
Apportez ceci à votre prochaine conversation avec un fournisseur, Screenz compris
Vous n’avez pas besoin d’avoir une formation en statistiques pour mener cette conversation. Vous avez besoin de trois questions et de la volonté d’accepter un honnête « nous ne savons pas encore », si c’est la réponse que vous obtenez. Posez les trois questions ci-dessus à votre fournisseur actuel, ou au prochain qui vous proposera un score, et observez si la réponse consiste en un chiffre et une méthodologie précis — ou en une reformulation assurée de la revendication d’exactitude que vous aviez déjà entendue.
L’écart entre ces deux réponses est précisément tout l’enjeu.
Vous êtes curieux de savoir à quoi ressemble concrètement une présélection validée par les résultats ? Découvrez comment Screenz l’aborde.
