Skip to main content

Hace unos meses, asistí a una reunión de evaluación de contratación en la que la puntuación de una herramienta de selección con IA había sido el factor decisivo para hacer una oferta. El candidato obtuvo una puntuación muy por encima del umbral, el equipo se sintió satisfecho y la vacante se cerró dos días más rápido de lo habitual.

Seis semanas después, esa persona ya no estaba.

Nadie en la sala pudo decirme si alguna vez se había comprobado la puntuación comparándola con un resultado real —bueno o malo—. Simplemente se había confiado en ella, como se confía en un termómetro sin preguntarse jamás quién lo calibró.

Por eso existe Screenz, y por eso existe también este artículo.

Si estás evaluando herramientas de selección con IA, has visto las cifras de precisión que los proveedores destacan —89 % esto, 94 % aquello, «supera la revisión manual». Esas cifras suelen ser ciertas. También suelen responder a una pregunta diferente de la que realmente estás planteando.

Qué suele significar «precisión» (y qué mide Screenz en su lugar)

La mayoría de las afirmaciones sobre precisión de los proveedores de herramientas de selección con IA describen hasta qué punto la herramienta relaciona un currículum o perfil con una descripción de puesto: extrae habilidades, cargos y años de experiencia, y luego clasifica a los candidatos según los criterios establecidos. Eso es real, medible y verdaderamente útil. Simplemente no es lo mismo que predecir cómo se desempeñará realmente alguien una vez contratado.

Son dos preguntas diferentes:

  • Precisión de coincidencia: ¿El perfil de este candidato se parece a lo que dijimos que queríamos?
  • Validez predictiva: ¿Una puntuación alta se correlaciona realmente con un buen desempeño o una mayor permanencia una vez que la persona ocupa el puesto?

Una herramienta puede ser excelente en lo primero y no haber demostrado nada en lo segundo. La mayoría del marketing de los proveedores no distingue entre ambas cosas, y la mayoría de los compradores no sabe que debe preguntar; así es exactamente como una puntuación bien promocionada termina tratándose como una verdad incuestionable en una reunión de evaluación de contratación.

En Screenz, tratamos estos aspectos como dos cifras separadas, no como una única puntuación combinada, porque fusionarlos es precisamente lo que hace que una herramienta de coincidencia termine promocionándose como una herramienta predictiva.

La pregunta que creamos Screenz para responder

En la investigación existe un nombre para esto: validez predictiva, la correlación entre la puntuación de una evaluación y una medida independiente posterior del desempeño, como las valoraciones del gerente, la producción o la permanencia a 12 meses. Se puntúa de 0 (ninguna relación) a 1 (predicción perfecta) y, en el mundo real, nada relacionado con la contratación se acerca a 1.

Como contexto, la investigación metaanalítica sobre entrevistas estructuradas —el pariente más cercano y mejor estudiado de los agentes de entrevista con IA actuales— suele situar los coeficientes de validez entre 0,28 y 0,30, dependiendo de la dimensión del desempeño medida. Esas cifras reflejan décadas de perfeccionamiento y se consideran un resultado sólido en la selección de personal. Están muy lejos de lo que una cifra destacada como «94 % de precisión» implica para un comprador que no domina la diferencia, y representan un umbral significativamente más alto que el que la mayoría de los proveedores de herramientas de selección con IA está dispuesta a aceptar.

Esta es exactamente la pregunta que creamos la Capa de Inteligencia de Screenz para seguir respondiendo. Cada candidato recibe la misma entrevista estructurada y específica para el puesto. Después, los candidatos se clasifican según esos criterios, con la transcripción y el razonamiento adjuntos, para que una persona revisora pueda comprobar el trabajo del modelo en lugar de aceptar la puntuación por fe. Una vez que alguien es contratado, hacemos un seguimiento de las señales de seguimiento y permanencia comparándolas con lo que la entrevista indicó sobre esa persona, y utilizamos ese patrón para determinar la clasificación de la siguiente lista de finalistas. Ese ciclo es el objetivo principal: la validez no es una afirmación que hacemos una sola vez en el lanzamiento, sino algo que el sistema vuelve a comprobar continuamente frente a los resultados a medida que llegan.

Así que cuando un proveedor afirma que su herramienta predice el desempeño, hay una pregunta que va directamente al fondo del asunto:

«¿Frente a qué resultado se validó, cómo se midió y durante qué periodo?»

Si la respuesta sincera es «todavía no lo hemos medido», eso no implica automáticamente que deba descartarse; simplemente significa que estás comprando una herramienta de coincidencia, no una predictiva, y que tu dependencia de la puntuación en los casos dudosos debe ajustarse en consecuencia.

Tres preguntas que debes hacerte antes de confiar en una puntuación (incluido Screenz)

  1. ¿Frente a qué resultado se validó y cuánto tiempo después de la contratación?

“Predice el éxito” puede significar un indicador de rendimiento a 30 días, una cifra de retención a 12 meses o la evaluación intuitiva de un gerente. Pregunta cuál de ellos es y pregunta cómo se definió el “éxito” antes de realizar el estudio, no después, cuando es fácil elegir la métrica que hace que el resultado parezca mejor.

  1. ¿Se validó con datos como los tuyos o se tomaron prestados de otro lugar?

Un estudio de validez realizado con la base de clientes más amplia de un proveedor no se aplica automáticamente a tus puestos, sector o mercado laboral. Pregunta si la evidencia incluye algo que se parezca a tu contexto y si el proveedor ofrece una forma de validar la herramienta con tus propios datos de resultados de manera continua, no solo durante la etapa de venta.

  1. ¿Cuál es la proporción de impacto adverso y quién la comprobó?

Según la regla de las cuatro quintas partes, ampliamente utilizada, conviene investigar una tasa de selección de cualquier grupo que sea inferior al 80 % de la tasa del grupo con la puntuación más alta. Una herramienta puede tener una validez predictiva aceptable y aun así generar un impacto desigual; son preguntas distintas, y un proveedor que solo puede responder una de ellas en realidad no ha respondido ninguna.

Estas no son situaciones hipotéticas para nosotros. Son las tres preguntas que Intelligence Layer está diseñado para seguir respondiendo, no solo una vez durante el lanzamiento, sino de manera continua a medida que llegan nuevos datos de resultados.

Nada de esto tiene que ver con dudar de la IA como categoría. Tiene que ver con la diferencia entre un proveedor que te dice que su puntuación funciona y uno que te muestra la evidencia de que funciona, para obtener resultados importantes para tu empresa, no solo aquellos que son fáciles de promocionar.

Por qué creamos Screenz en torno a esta pregunta

Seré claro: esta no es una lista neutral. Creamos Screenz en torno a un agente de IA que realiza entrevistas estructuradas, no uno que simplemente analiza un currículum, lo que significa que la pregunta sobre la validez predictiva no es abstracta para nosotros. Es el producto en su totalidad. La eficiencia es fácil de demostrar y de promocionar: listas de preseleccionados más rápidas y un menor coste por contratación. La validez de los resultados es más difícil de desarrollar y lleva más tiempo demostrarla, lo que probablemente explica por qué menos proveedores la sitúan en primer plano.

Preferimos que se nos juzgue por la pregunta más difícil. Si nos preguntas “¿con respecto a qué se validó?”, queremos que esa sea la parte más fácil de la conversación, no la parte que se desvía hacia una demostración de funciones.

Lleva esto a tu próxima conversación con un proveedor, incluida Screenz

No necesitas tener formación en estadística para mantener esta conversación. Necesitas tres preguntas y la disposición a aceptar un sincero “todavía no lo sabemos”, si esa es la respuesta que recibes. Lleva las tres preguntas anteriores a tu proveedor actual o al próximo que te presente una puntuación, y observa si la respuesta incluye una cifra y una metodología específicas o una reformulación segura de la afirmación de precisión que ya conocías.

La diferencia entre esas dos respuestas es el punto central.

¿Te interesa saber cómo es en la práctica una selección de personal validada según los resultados? Descubre cómo lo aborda Screenz.