# Cómo diseñar una entrevista estructurada con IA — Criterio Talent

> Guía de diseño de entrevistas estructuradas con IA: escalas antes que preguntas, reactivos conductuales, evidencia citada y dónde termina el sistema.

URL: https://criteriotalent.com/recursos/entrevista-estructurada-con-ia/

---

**Entrega 12 · agosto de 2026**

# Cómo diseñar una entrevista estructurada con IA que deje evidencia útil y conserve la decisión humana

Ocho decisiones de diseño, en orden. La primera es la que casi todo el mundo se salta: no se le pide a un modelo que juzgue, se le pide que documente.

Método · Diseño de entrevistas

Publicado el 29 de agosto de 2026 · 7 min de lectura

**En corto**

Se diseña invirtiendo el encargo: el sistema no califica, documenta. Primero se escriben las escalas de cada competencia, después los reactivos conductuales que las exploran, y se le exige a cada conclusión que cite la frase textual que la sustenta. La decisión de avanzar o descartar la toma una persona identificada, dentro de la herramienta, y queda registrada.

Casi todas las implementaciones de entrevistas con IA que he visto empiezan por el mismo sitio: se le pasa la conversación a un modelo y se le pide una calificación. La calificación llega, se ve profesional, y la primera vez que alguien pregunta por qué este candidato sacó 7 y aquél 8, no hay nada que enseñar. Ese es el momento en el que el proyecto muere, aunque tarde unos meses en enterarse.

Lo que sigue son ocho decisiones de diseño, en el orden en que hay que tomarlas. Ninguna es sobre el modelo. Todas son sobre qué se le pide, qué se le deja ver y qué se conserva de lo que produjo.

## El trabajo del sistema es documentar, no juzgar

La inversión que lo cambia todo: la salida principal no es un número, es un expediente. Una calificación sin la frase que la sustenta no se puede defender ante el área que contrata, ni ante el candidato, ni ante una revisión interna. Una frase con su contexto se defiende sola, aunque la calificación se discuta.

En la práctica esto significa que la instrucción al modelo no es «evalúa a este candidato», sino «para cada competencia, encuentra en esta transcripción lo que la persona dijo que sea relevante, cítalo, y sólo entonces asigna un nivel». El orden importa: si el nivel se decide antes que la cita, la cita se elige para justificarlo.

## Primero la escala, después la pregunta

Una competencia sin niveles descritos produce un número que significa lo que cada lector quiera. «Comunicación: 3 de 5» no informa a nadie. Antes de escribir un solo reactivo hay que escribir qué distingue un nivel del siguiente, y hay que escribirlo en términos de conducta observable, no de atributos de la persona.

Un ejemplo, para resolución de conflicto con proveedores. Nivel 1: describe el problema pero no una acción propia. Nivel 2: actúa, pero después de que el problema escaló. Nivel 3: actúa el mismo día, involucra a las partes afectadas y cuantifica el impacto. Nivel 4: todo lo anterior, y además deja un mecanismo para que no vuelva a pasar.

La prueba de que una escala está bien escrita es sencilla: dos personas del equipo leen la misma respuesta por separado y asignan el mismo nivel. Si no coinciden, el problema no es el modelo, es la escala — y ningún sistema va a arreglar lo que el equipo no tiene claro.

## Un reactivo es una pregunta que sólo se puede contestar con una historia

«¿Cómo manejas el conflicto?» recoge opiniones sobre uno mismo. «Cuéntame de una vez que un proveedor incumplió y tuviste que responder» recoge conducta. La diferencia no es de estilo: es la diferencia entre datos que se pueden verificar y datos que no.

Una respuesta completa a un reactivo conductual tiene tres partes: la situación, lo que la persona hizo —ella, no «el equipo»— y qué pasó después. Esas tres partes son lo que la escala necesita para asignar un nivel, y son también lo que hay que definir por escrito para que el entrevistador sepa cuándo una respuesta está incompleta.

Y aquí entra la repregunta, que es parte del reactivo y no un adorno. Si una persona contesta esto:

no hay nada que evaluar. Hay una situación sin acción propia y sin resultado. Un guion bien diseñado dice explícitamente qué le falta a esa respuesta y qué repreguntar para conseguirlo, antes de pasar al siguiente reactivo. Un sistema que no repregunta produce transcripciones largas y expedientes vacíos.

## La misma pregunta para todos, o no hay comparación

Estructurada significa exactamente esto: los mismos reactivos, en el mismo orden, evaluados con la misma escala, para todos los candidatos de una vacante. En el momento en que a un candidato se le pregunta algo que a otro no, lo que se produjo no son dos evaluaciones comparables: son dos entrevistas distintas con una tabla encima.

De ahí se sigue una consecuencia técnica que casi siempre se olvida: el guion tiene que estar versionado. Si alguien afina un reactivo a mitad del proceso y las entrevistas anteriores no recuerdan con qué versión se corrieron, la comparación entre el candidato de marzo y el de mayo es una coincidencia. Versionar no es burocracia: es lo que hace que una tabla siga significando algo seis meses después.

## La evidencia se cita, no se resume

Un resumen es una interpretación con menos palabras. Lo que sostiene una conclusión es la frase textual, y su posición: en qué minuto, en qué turno, dentro de qué reactivo. Con eso, quien lee el reporte puede ir del veredicto a la frase y de la frase a la grabación, y comprobar por su cuenta si la conclusión está bien tomada.

La regla que conviene adoptar es dura y simple: si una conclusión no puede citar, no es una conclusión, es una impresión — y se retira del reporte. Cuesta perder unas cuantas valoraciones. Cuesta mucho más defender una que nadie puede rastrear.

Consecuencia de arquitectura: la transcripción hay que guardarla turno por turno y con marca de tiempo, no sólo procesarla al vuelo. Un sistema que transcribe para evaluar y luego tira el texto puede producir la calificación, pero nunca podrá volver a sustentarla.

## Lo que el sistema no debe mirar

La tentación técnica, cuando ya hay video, es analizarlo: gesto, tono, ritmo, «confianza». Vale la pena resistirla por dos razones distintas y ambas suficientes.

- La primera es de validez. Para la enorme mayoría de los puestos, cómo se ve o cómo suena una persona no predice cómo va a trabajar; lo que dice que hizo, sí, y encima se puede verificar.
- La segunda es de riesgo. El rostro, el acento y el ritmo del habla son aproximaciones bastante directas al origen, la edad y la condición de una persona. Un sistema que los mira está discriminando aunque nadie lo haya querido, y no hay forma de demostrar que no lo hizo.

La forma de sostener esto no es una política escrita: es la arquitectura. Si el componente que evalúa recibe únicamente el texto de lo que se dijo, no puede caer en la tentación, y esa restricción se puede enseñar. Una política se firma; una entrada de datos se comprueba.

## Dónde termina el sistema

El sistema produce evaluación y evidencia. Avanzar o descartar es una decisión humana, y tiene que ejecutarse dentro de la herramienta por una persona identificada, no en un correo paralelo o en una hoja aparte.

Si la decisión ocurre fuera, el rastro se rompe justo donde importa: se conserva el detalle de cómo se evaluó y se pierde el dato de quién decidió. Meses después, la pregunta incómoda no es «¿cómo lo evaluaron?», es «¿quién dijo que no?».

## Lo que hay que poder contestar seis meses después

Ésta es la prueba final del diseño. Con el proceso ya cerrado y el equipo ya cambiado, alguien pregunta por un candidato concreto. El sistema tiene que poder responder, sin que nadie reconstruya nada de memoria:

- Qué se le preguntó, y con qué versión del guion.
- Qué contestó, textualmente y con su marca de tiempo.
- Qué se concluyó de cada competencia, y con qué fragmento se sustenta.
- Quién tomó la decisión, y a qué hora.
- Hasta cuándo se conserva ese material, y qué pasa después.

Si alguna de esas cinco no se puede contestar, la estructura era decorativa. Y conviene descubrirlo en el diseño, no en la primera vez que alguien pregunta en serio.

## Lo que esto no resuelve

Una entrevista estructurada bien diseñada hace comparable la etapa en la que se aplique —el cribado, la ronda técnica o la conversación con dirección— y la deja documentada. Lo que no hace es arreglar una vacante mal definida: si nadie tiene claro qué se busca, la estructura sólo hará que todos los candidatos sean evaluados con la misma confusión.

Lo que sí hace, y no es poco, es acabar con el peor escenario de un proceso corporativo: una decisión que nadie puede explicar, sobre personas que se tomaron el trabajo de contestar.

## Preguntas sobre esta entrega

### ¿Una entrevista estructurada no vuelve la conversación rígida?

La estructura está en los reactivos y en la escala, no en el ritmo. La repregunta es parte del diseño justamente para eso: el guion define qué hay que conseguir de cada reactivo, y la conversación llega ahí por donde la persona la lleve.

### ¿Cuántas competencias caben en una primera ronda?

Menos de las que se quisiera. Entre cuatro y seis reactivos permiten profundidad; una lista de doce produce respuestas de titular que no sustentan ningún nivel. Sobre cuánto cabe en poco tiempo, la entrega [de noviembre](https://criteriotalent.com/recursos/que-cabe-en-una-ronda-de-entrevista/) lo mide.

### ¿Cambia algo en un puesto directivo?

Cambia el guion y la profundidad, no el método. En una dirección hay menos candidatos, pero la decisión pesa más y se revisa más: que las tres conversaciones hayan explorado lo mismo, y que cada conclusión pueda citar dónde se dijo, es exactamente lo que hace defendible una decisión de ese tamaño.

**Para seguir leyendo en el sitio**

### [Soluciones](https://criteriotalent.com/soluciones/)

Cómo se configura para alto volumen, perfiles técnicos, dirección y procesos de varias rondas.

### [Plataforma](https://criteriotalent.com/plataforma/)

Cómo conduce la entrevista, repregunta y cita la evidencia de cada conclusión.

### [Integraciones](https://criteriotalent.com/integraciones/)

Cómo su ATS pide la entrevista y recibe el reporte, sin que nadie vuelva a teclear nada.

### [Contacto](https://criteriotalent.com/contacto/)

Una demostración de 30 minutos sobre una vacante real suya.

**Otras entregas**

**Método · Instrumentos de evaluación**

### [Matriz de competencias y rúbricas: cómo escribir niveles que dos personas interpreten igual](https://criteriotalent.com/recursos/matriz-de-competencias-y-rubricas/)

Casi todas las matrices de competencias son una lista de sustantivos con una escala del uno al cinco. Eso no es un instrumento: es un formato. El instrumento son los descriptores.

**Método · Evidencia y trazabilidad**

### [Evidencia por turno: qué guardar de una entrevista para poder defenderla seis meses después](https://criteriotalent.com/recursos/evidencia-por-turno-trazabilidad/)

La pregunta incómoda no llega el día de la decisión: llega medio año después, cuando el equipo ya cambió. Esto es lo que tiene que estar guardado para contestarla.

**Método · Comparación y decisión**

### [Cómo comparar candidatos de una misma vacante sin comparar impresiones](https://criteriotalent.com/recursos/comparar-candidatos-sin-comparar-impresiones/)

Cuatro condiciones que tienen que cumplirse antes de poner dos entrevistas una al lado de la otra, y qué hacer con la tabla cuando por fin se puede.

**Siguiente paso**

## Véalo con una vacante suya sobre la mesa.

Treinta minutos: se define una entrevista a partir de su job post, se recorre como la ve el candidato y se lee un reporte con su evidencia.
