
En una frase: desempeño = criterio claro + observación + feedback útil.
1. Definición y propósitos
Aguinis describe la gestión del rendimiento (performance management) como un proceso continuo de identificación, medición y desarrollo del desempeño de individuos y equipos, alineado con los objetivos estratégicos de la organización. La evaluación del desempeño es el componente de medición y juicio dentro de ese proceso más amplio.
- Propósito administrativo: decisiones de compensación, promoción, permanencia, bonos o sanciones. Exige criterios defendibles y documentación.
- Propósito de desarrollo: identificar fortalezas, brechas y planes de desarrollo, coaching o formación. Prioriza utilidad del feedback sobre el ranking.
- Propósito estratégico: alinear conductas y resultados individuales con metas de la unidad y de la organización (por ejemplo, vía MBO u OKR).
- Propósito de documentación y clima: dejar registro de expectativas y de conversaciones de desempeño, reduciendo arbitrariedad percibida.
2. Criterios: rasgos, conductas y resultados
El criterio es aquello que se considera buen desempeño. Murphy, Cleveland y DeNisi han insistido en que gran parte de los problemas del sistema empiezan cuando el criterio está mal definido o mal medido.
- Criterios de rasgos: adjetivos estables (proactivo, leal, creativo). Son fáciles de poner en una escala, pero difíciles de observar de forma confiable y fáciles de contaminar con simpatía.
- Criterios de conducta: acciones observables (responde al cliente en menos de X minutos, documenta el caso en el sistema). Facilitan el feedback y el entrenamiento del evaluador.
- Criterios de resultados: salidas medibles (unidades vendidas, errores por mil, proyectos cerrados a tiempo). Útiles cuando el resultado depende en buena medida del esfuerzo individual; problemáticos cuando el contexto pesa más que la persona.
2.1. Contaminación y deficiencia del criterio
- Contaminación del criterio: se incluye en la evaluación algo irrelevante para el desempeño real (por ejemplo, castigar a quien llega dos minutos tarde en un rol por resultados, o premiar afinidad personal).
- Deficiencia del criterio: se deja fuera una parte importante del desempeño (por ejemplo, solo medir ventas y omitir trabajo en equipo o calidad del servicio).
- Relevancia del criterio: la porción del desempeño verdadero que el sistema logra capturar sin contaminar ni empobrecer.
| Tipo de criterio | Ejemplo | Fortaleza | Debilidad frecuente |
|---|---|---|---|
| Rasgos | Es confiable / es innovador | Rápido de administrar | Baja observabilidad, alto sesgo |
| Conductas | Documenta cada interacción en el CRM el mismo día | Feedback concreto y entrenable | Listas largas si el puesto es complejo |
| Resultados | Cierra 12 proyectos al trimestre con NPS de al menos X | Alineación con metas de negocio | Ignora restricciones de contexto y trabajo colaborativo |
3. Métodos de evaluación del desempeño
Los métodos no son intercambiables: cada uno resuelve un problema distinto y genera sesgos distintos.
- Escalas gráficas de calificación: anclas numéricas o adjetivas (1 a 5) sobre dimensiones. Baratas y comunes; vulnerables a leniency, tendencia central y halo si las anclas son vagas.
- BARS (Behaviorally Anchored Rating Scales): escalas con anclas conductuales concretas en cada nivel. Elevan claridad del estándar; cuestan más de construir.
- BOS (Behavioral Observation Scales): frecuencia con la que se observa una conducta (rara vez, a veces, con frecuencia). Enfocan observación más que juicio global de excelente o malo.
- 360 grados: múltiples fuentes (jefe, pares, subordinados, clientes, autoevaluación). Amplían perspectiva; no eliminan sesgos y exigen clima de confianza y anonimato bien gestionado.
- MBO / OKR: metas acordadas y revisión de resultados (Management by Objectives; Objectives and Key Results). Fuertes en alineación estratégica; débiles si las metas son imposibles, ambiguas o puramente individuales en trabajo interdependiente.
- Forced distribution: obliga a repartir calificaciones en una curva (por ejemplo, 10 por ciento alto, 70 medio, 20 bajo). Puede forzar diferencias artificiales en equipos pequeños y homogéneos.
- Incidentes críticos: registro de episodios especialmente efectivos o inefectivos. Excelente materia prima para feedback; insuficiente solo si no se integra en un juicio periódico.
| Método | Unidad de juicio | Cuándo pesa más | Riesgo típico |
|---|---|---|---|
| Escala gráfica | Dimensión + número | Sistemas simples y masivos | Anclas vagas y sesgos de rater |
| BARS | Nivel anclado en conducta | Puestos con conductas críticas claras | Costo de desarrollo |
| BOS | frecuencia de conductas | Entrenamiento y coaching | Carga de observación |
| 360 grados | Multi-fuente | Desarrollo de liderazgo | Creer que más fuentes equivalen a cero sesgo |
| MBO/OKR | Metas y resultados | Alineación estratégica | Metas mal diseñadas o gaming |
| Forced distribution | Ranking forzado | Culturas de diferenciación extrema | Competencia tóxica, injusticia en equipos chicos |
| Incidentes críticos | Episodios clave | Feedback rico y defensa documental | Sesgo de recencia si no se registra a lo largo del periodo |
4. Errores del evaluador
Incluso con un buen formulario, el rater introduce error sistemático. Debes poder nombrar y ejemplificar cada uno:
- Efecto halo: una impresión global (positiva o negativa) colorea el conjunto de dimensiones. Es carismático, entonces le pongo alto en todo.
- Leniency / severity (indulgencia / severidad): tendencia a calificar a la gran mayoría alto o a la gran mayoría bajo.
- Tendencia central: concentrar calificaciones en el medio para evitar conflictos o decisiones difíciles.
- Recency (recencia): sobreponderar lo ocurrido en las últimas semanas del periodo evaluado.
- Contraste: juzgar a una persona en relación con la anterior evaluada, no respecto del estándar del puesto.
- Similar-to-me: favorecer a quienes se parecen al evaluador en valores, trayectoria o estilo.
| Error | Señal en el caso de examen | Mitigación práctica |
|---|---|---|
| Halo | Las dimensiones suben o bajan en bloque sin evidencia | Anclas conductuales; calificar dimensión por dimensión |
| Leniency / severity | Media del equipo pegada al techo o al piso | Entrenamiento de evaluadores; calibración entre jefes |
| Tendencia central | Pocos casos en extremos aunque el desempeño difiera | Forzar evidencia; revisar distribución con cuidado ético |
| Recencia | Un error de la última semana borra un año sólido | Diario de incidentes críticos a lo largo del ciclo |
| Contraste | Después del estrella del equipo, este parece flojo | Comparar con estándar del puesto, no con compañeros |
| Similar-to-me | Favorece a egresados de la misma universidad o estilo | Criterios observables; paneles de calibración |
HAL haloLEN leniency/severityityCEN centralREC recenciaCON contrasteSIM similar-to-me
Si el caso describe al jefe, busca cuál de estas seis letras encaja antes de inventar un sesgo genérico.
5. El ciclo de la evaluación del desempeño
Un sistema maduro no empieza el día del formulario. Sigue un ciclo:
- Definición de puestos y expectativas: partiendo del análisis de puesto, se clarifican responsabilidades, competencias y resultados esperados.
- Estándares de desempeño: se traducen expectativas en niveles observables o medibles, comunicados al inicio del periodo.
- Observación y registro continuo: el jefe (y otras fuentes) recolectan evidencia a lo largo del tiempo, no solo en la semana previa a la reunión.
- Calificación e integración: se aplica el método elegido (escala, BARS, metas, 360) y, si hay varios evaluadores, se calibra.
- Feedback y conversación: se devuelve información específica, bidireccional y orientada a conducta o resultados.
- Plan de desarrollo y seguimiento: acuerdos con plazos, recursos y criterios de seguimiento.
- Seguimiento: checkpoints intermedios que evitan la sorpresa de fin de año.
6. Condiciones de un sistema justo y útil
La percepción de justicia importa tanto como la precisión técnica. Un sistema puede ser psicométricamente ordenado y, aun así, erosionar el compromiso si se percibe como arbitrario.
- Estándares claros y conocidos de antemano (justicia procedimental y de información).
- Oportunidad de ser escuchado en la conversación de desempeño (voz del evaluado).
- Evaluadores entrenados en observación, sesgos y entrega de feedback.
- Consistencia entre evaluadores (calibración), sin forzar igualdad falsa de contextos distintos.
- Separación relativa de fines cuando sea posible: no todo desarrollo debe mezclarse el mismo día con decisión de bono, aunque en la práctica a menudo conviven.
- Vínculo matizado con compensación: conectar desempeño y pago puede alinear esfuerzo, pero un vínculo rígido y opaco fomenta gaming, aversión al riesgo y deterioro del trabajo colaborativo.
- Vínculo con desarrollo: la evaluación solo cierra el círculo si genera plan, recursos y seguimiento; si solo archiva un número, se vacía de sentido.
7. Errores frecuentes en el parcial
8. Para el parcial
- Tres propósitos de la evaluación (administrativo, desarrollo, estratégico) con un ejemplo cada uno.
- Diferencia entre criterios de rasgos, conductas y resultados.
- Contaminación vs. deficiencia del criterio.
- Comparar BARS, BOS, 360, MBO y forced distribution.
- Identificar en un caso el error del evaluador (halo, leniency, recencia, contraste, similar-to-me).
- Pasos del ciclo: estándares, observación, feedback, plan de desarrollo.
- Por qué el 360 no elimina sesgos automáticamente.
- Desempeño no es lo mismo que potencial.
- Criterio primero; método después; evaluador introduce error de forma recurrente.
- Contaminación suma basura; deficiencia quita lo importante.
- BARS ancla conductas; 360 multiplica fuentes; MBO alinea metas.
- Halo, leniency, central, recencia, contraste, similar-to-me.
- Ciclo: definir, estandarizar, observar, calificar, feedback, plan, seguimiento.
9. Preguntas de autoevaluación
1. Diferencia evaluación del desempeño y gestión del rendimiento (performance management).
La evaluación es el acto de medir y juzgar el desempeño respecto de estándares. La gestión del rendimiento, en la línea de Aguinis, es el proceso continuo que incluye planificación de metas, seguimiento, desarrollo y alineación estratégica. La evaluación es una pieza; la gestión es el sistema completo.
2. Un jefe califica alto en trabajo en equipo, calidad e innovación a alguien que solo conoce por ser muy simpático. Qué error predomina?
Efecto halo: una impresión global positiva contamina dimensiones distintas sin evidencia específica por dimensión. La mitigación pasa por anclas conductuales y por exigir ejemplos observables en cada eje.
3. Cuándo un criterio de resultados puede ser deficiente?
Cuando omite partes centrales del rol: por ejemplo, medir solo número de llamadas en un centro de contacto e ignorar calidad de resolución, cumplimiento ético o colaboración con otras áreas. El resultado parcial no representa el desempeño completo.
4. Por qué la forced distribution es polémica en equipos pequeños?
Porque obliga a etiquetar a alguien como bajo aunque el grupo completo esté por encima del estándar del puesto. Genera diferencias artificiales, puede dañar la colaboración y debilita la percepción de justicia si el tamaño del equipo no sostiene una curva forzada.
5. Señala dos condiciones para que un sistema de evaluación se perciba como justo.
Estándares comunicados de antemano y oportunidad de voz en la conversación de desempeño. Se suman evaluadores entrenados, consistencia entre casos similares y un vínculo transparente (aunque matizado) con desarrollo y compensación.
7. Mini caso de calibración
Dos jefes evalúan roles equivalentes. Uno promedia 4.6 sobre 5; el otro, 3.1. Si la empresa paga bono por rating sin calibrar, está premiando al jefe indulgente, no al equipo de mayor aporte. La reunión de calibración exige evidencia: ¿qué conductas o resultados sostienen el 5?, ¿qué estándar común de “supera expectativas” se usará? Sin esa conversación, el sistema enseña política local, no desempeño.
La calibración no busca uniformar personas; busca uniformar la vara. Cuando funciona, reduce sorpresas, fortalece la defendibilidad y obliga a los mandos a observar con mayor rigor durante el período. Cuando se hace mal, se convierte en regateo de cupos y en distribución forzada disfrazada.
Para el estudiante, el caso sirve para conectar tres ideas: errores del evaluador, justicia procedimental y propósito del sistema. Si el propósito es desarrollo, la calibración protege la calidad del feedback. Si el propósito es compensación, la calibración protege equidad entre áreas. Si no hay propósito claro, la calibración solo administra conflicto.
🎮 12 experiencias — ¿prefieres practicarlo jugando? Psique Juegos — aprende jugando →
Ponlo en práctica
Test de conocimiento: Procesos Psicológicos
Pon a prueba lo que sabes de este tema: 12 preguntas reales, tu nivel al final y los temas exactos a reforzar.