# Sesgo en entrevistas con IA: qué se puede reducir — Criterio Talent

> Qué sesgo reduce una entrevista estructurada, qué sesgo aporta el modelo, por qué no mirar rostro ni acento, y cómo medir impacto adverso sin prometer imparcialidad.

URL: https://criteriotalent.com/recursos/sesgo-en-entrevistas-con-ia/

---

**Entrega 06 · febrero de 2026**

# Sesgo en entrevistas con IA: qué se puede reducir y qué no se puede prometer

La estructura reduce una fuente de sesgo concreta y medible. El modelo trae la suya puesta y no se le quita con una instrucción. Distinguir las dos cosas es el trabajo.

Criterio · Sesgo y equidad

Publicado el 29 de agosto de 2026 · 6 min de lectura

**En corto**

Se puede reducir la varianza entre entrevistadores —que distintas personas pregunten distinto y midan distinto—, y se puede evitar que el sistema mire señales que funcionan como aproximación al origen, la edad o la condición de alguien. No se puede eliminar el sesgo: el modelo trae el suyo del entrenamiento, el guion refleja el criterio de quien lo escribió, y quien decide sigue siendo una persona. Lo honesto es reducir lo reducible y medir lo que quede.

Casi cualquier plataforma de entrevistas con IA promete, en algún lugar de su material, reducir el sesgo. Algunas prometen eliminarlo. La segunda promesa es falsa y la primera es cierta sólo si se dice de qué sesgo se habla, porque hay varios y no se comportan igual.

Esta entrega separa los que se pueden atacar de los que no, y termina donde tiene que terminar: en lo que no se puede prometer sin mentir.

## Lo que sí se reduce: la varianza entre entrevistadores

En un proceso corporativo, buena parte de la injusticia no viene de la mala intención sino de la dispersión. Tres personas entrevistan y preguntan cosas distintas, profundizan distinto, y valoran con criterios que nunca escribieron. A dos candidatos equivalentes les pasan cosas distintas según a quién les tocó, y ese resultado es indistinguible del sesgo aunque nadie tuviera una preferencia.

Ése es el sesgo que la estructura ataca de frente, y lo hace por construcción: los mismos reactivos, en el mismo orden, evaluados con la misma escala descrita en términos de conducta observable. No requiere confiar en nadie, se puede comprobar leyendo el guion, y es medible — si dos personas del equipo asignan niveles distintos a la misma respuesta, la escala todavía no está lista.

También reduce el efecto de orden y de fatiga: el reactivo número cuatro es el mismo a las nueve de la mañana que a las seis de la tarde, y no se acorta porque el entrevistador ya lleve seis conversaciones encima.

## Lo que el modelo trae puesto

Un modelo de lenguaje aprendió de texto escrito por personas, y con él aprendió las asociaciones que ese texto contiene. Algunas son útiles para evaluar una respuesta y otras son prejuicios con buena redacción. No hay forma de separarlas por dentro, y no hay instrucción que las apague: pedirle a un modelo que «sea imparcial» produce texto que afirma imparcialidad, que no es lo mismo.

Lo que sí se puede hacer es estrechar su margen. Un modelo al que se le pide una opinión general sobre un candidato tiene todo el espacio del mundo para traer lo que trae. Un modelo al que se le pide localizar en una transcripción la evidencia relevante para una competencia con niveles descritos, citarla, y sólo entonces asignar un nivel, tiene mucho menos espacio: la tarea es casi de lectura, y el resultado se puede contrastar contra el texto citado.

Eso reduce la superficie, no la elimina. La elección de qué fragmento es «relevante» sigue siendo suya, y ahí cabe una preferencia. Por eso la cita es tan importante: es lo que permite que una persona vea qué eligió y discrepe.

## El rostro, el acento y el ritmo del habla

Cuando ya hay video, la tentación técnica es analizarlo: gesto, tono, velocidad, «seguridad». Hay dos razones para no hacerlo, y cada una basta por su cuenta.

- Validez. Para la enorme mayoría de los puestos, cómo se ve o cómo suena una persona no dice nada útil sobre cómo va a trabajar. Lo que dice que hizo, sí, y además se puede verificar con una referencia.
- Riesgo. El rostro, el acento y el ritmo del habla son aproximaciones bastante directas al origen, la edad y la condición de una persona. Un sistema que los mira está usando esas variables aunque nadie lo haya querido, y quien lo opera no tiene forma de demostrar que no lo hizo.

El segundo punto se subestima. La pregunta que llega en una revisión no es «¿usaron el origen de la persona para decidir?», es «¿pueden demostrar que no?». Un sistema que analiza señales audiovisuales no puede contestar que no, porque la variable protegida está dentro de la señal que sí miró.

## Restringir la entrada es arquitectura, no política

La forma habitual de responder a lo anterior es un documento: una política que declara que no se analiza el rostro. Sirve poco, porque una política describe una intención y hay que creerla.

La versión que se sostiene es hacer que el componente que evalúa reciba únicamente el texto de lo que se dijo. Si el video nunca llega a ese componente, la restricción deja de depender de la disciplina de nadie y pasa a ser una propiedad del sistema — algo que se puede enseñar, revisar y comprobar. Es la diferencia entre una política que se firma y una entrada de datos que se inspecciona. En [la página de plataforma](https://criteriotalent.com/plataforma/) está descrito cómo se aplica aquí, y en [la de seguridad](https://criteriotalent.com/seguridad/) qué recibe cada proveedor que interviene.

La grabación en video puede seguir existiendo por otras razones —que la persona pueda comprobar qué se grabó, que una valoración se pueda contrastar—, y eso es compatible con que no entre en el análisis. Guardar y analizar son decisiones distintas y conviene tomarlas por separado.

## Cómo se sabe si hay impacto adverso

Todo lo anterior son argumentos de diseño. La única forma de saber qué está pasando de verdad es mirar los resultados: comparar tasas de avance entre grupos, sostenidas en el tiempo y sobre suficientes procesos, no sobre una vacante de ocho personas donde cualquier diferencia es ruido.

Aquí aparece la incomodidad que casi nunca se dice: no se puede medir lo que no se recoge. Para comparar tasas hace falta información demográfica de las personas, que muchas empresas no tienen y que recogerla tiene sus propias implicaciones de privacidad y su propio marco legal. La decisión de medir es real y tiene costo; lo que no es honesto es afirmar equidad sin haberla medido nunca.

Cuando sí se mide, lo que se busca no es una diferencia puntual sino una diferencia sostenida, y el umbral a partir del cual una diferencia importa depende de la jurisdicción y del criterio del área legal de cada empresa. Lo que un sistema de evaluación puede aportar a esa revisión es materia prima: qué se preguntó, qué se respondió y con qué fragmento se sustentó cada nivel, que es lo que permite distinguir un patrón real de una coincidencia.

## La decisión humana es el último control, y también una fuente de sesgo

Que la decisión la tome una persona identificada es una garantía y conviene no exagerarla. Las personas también traen sus preferencias, y una evaluación bien sustentada se puede ignorar tan fácilmente como una mal hecha.

Lo que cambia es que ahora se nota. Con evidencia citada y bitácora, apartarse de lo que dice el expediente deja rastro: alguien avanzó a la persona con el perfil más bajo en la competencia que más pesaba, y eso es visible. No lo impide —a veces hay razones buenas para apartarse— pero obliga a que sea una decisión consciente y no un reflejo. La revisión de esos casos es, en la práctica, uno de los usos más útiles de la bitácora que describe [la entrega sobre trazabilidad](https://criteriotalent.com/recursos/evidencia-por-turno-trazabilidad/).

## Lo que no se puede prometer

No se puede prometer eliminar el sesgo. No se puede prometer que un modelo sea imparcial, ni que una escala escrita por un equipo no refleje el criterio de ese equipo, ni que una decisión humana sea neutral. Cualquier proveedor que lo prometa está vendiendo tranquilidad, no un sistema.

Lo que sí se puede sostener es más modesto y bastante más útil: que todos los candidatos de una vacante respondieron lo mismo, que la valoración se construyó sobre lo que dijeron y no sobre cómo se ven, que cada conclusión se puede rastrear hasta la frase que la origina, y que la decisión tiene nombre y hora. Eso no vuelve justo un proceso por sí solo. Lo vuelve auditable, que es la condición para poder discutir si es justo.

## Preguntas sobre esta entrega

### ¿Una entrevista con IA es más o menos sesgada que un panel humano?

Depende de con qué panel se compare y de cómo esté diseñada. Frente a un panel sin guion, la estructura elimina una fuente de dispersión que es real y grande. Frente a un panel entrenado con la misma rúbrica, la ventaja es de consistencia y de rastro, no de imparcialidad.

### ¿Sirve de algo quitar el nombre del candidato antes de evaluar?

Ayuda contra una señal concreta, y no es suficiente: el propio texto de una respuesta puede llevar señales de origen o de generación. Reduce, como todo lo demás en esta lista; no cierra el tema.

### ¿Cómo se audita esto desde fuera?

Pidiendo tres cosas: el guion con sus versiones, qué entrada recibe exactamente el componente que evalúa, y una muestra de valoraciones con la cita que las sustenta. Con eso se puede formar un juicio propio; sin eso, sólo queda creer.

**Para seguir leyendo en el sitio**

### [Soluciones](https://criteriotalent.com/soluciones/)

Cómo se configura para alto volumen, perfiles técnicos, dirección y procesos de varias rondas.

### [Plataforma](https://criteriotalent.com/plataforma/)

Cómo conduce la entrevista, repregunta y cita la evidencia de cada conclusión.

### [Integraciones](https://criteriotalent.com/integraciones/)

Cómo su ATS pide la entrevista y recibe el reporte, sin que nadie vuelva a teclear nada.

### [Contacto](https://criteriotalent.com/contacto/)

Una demostración de 30 minutos sobre una vacante real suya.

**Otras entregas**

**Método · Comparación y decisión**

### [Cómo comparar candidatos de una misma vacante sin comparar impresiones](https://criteriotalent.com/recursos/comparar-candidatos-sin-comparar-impresiones/)

Cuatro condiciones que tienen que cumplirse antes de poner dos entrevistas una al lado de la otra, y qué hacer con la tabla cuando por fin se puede.

**Método · Experiencia del candidato**

### [Cómo diseñar una entrevista con IA que la persona no viva como un maltrato](https://criteriotalent.com/recursos/experiencia-del-candidato-con-ia/)

Casi todo lo que hace odiar una entrevista automatizada es una decisión de diseño, no una limitación técnica. Siete decisiones, y la incómoda va al final.

**Método · Instrumentos de evaluación**

### [Matriz de competencias y rúbricas: cómo escribir niveles que dos personas interpreten igual](https://criteriotalent.com/recursos/matriz-de-competencias-y-rubricas/)

Casi todas las matrices de competencias son una lista de sustantivos con una escala del uno al cinco. Eso no es un instrumento: es un formato. El instrumento son los descriptores.

**Siguiente paso**

## Véalo con una vacante suya sobre la mesa.

Treinta minutos: se define una entrevista a partir de su job post, se recorre como la ve el candidato y se lee un reporte con su evidencia.
