Skip to content

Condicionamiento operante de Skinner

💡 La idea central

La conducta no depende del estímulo que la precede, sino de la CONSECUENCIA que la sigue. (paráfrasis didáctica de Skinner, 1953)

🐦 + 🍞 → palanca → comida → repite  ·  🐦 + ⚡ → palanca → shock → se apaga

El tema en 3 frases

  1. El condicionamiento operante es aprendizaje por CONSECUENCIAS: la conducta que es seguida por algo bueno se repite más; la que es seguida por algo malo se repite menos.
  2. A diferencia del condicionamiento clásico (Pavlov), donde la conducta es elicitada por un estímulo previo, en el operante la conducta es emitida y opera sobre el ambiente para producir una consecuencia.
  3. Skinner lo formalizó con la caja de condicionamiento operante y descubrió los programas de refuerzo, que son la clave para entender por qué ciertas conductas (likes, tragamonedas,_scroll_ infinito) son casi imposibles de extinguir.

El truco para acordarlo · ACRÓNIMO

Los 4 tipos de consecuencias se ordenan con un signo (qué le pasa al estímulo) y un resultado (qué le pasa a la conducta). El acrónimo es:

Ponlo en práctica

Test: El condicionamiento operante (Skinner)

Refuerzos, castigos, programas de reforzamiento: la caja de Skinner por dentro.

👍 RP
Refuerzo +
sumar algo bueno
😌 RN
Refuerzo -
quitar algo malo
⚡ CP
Castigo +
sumar algo malo
🚫 CN
Castigo -
quitar algo bueno

Notas del cuaderno · cómo leer el acrónimo

  • R = Refuerzo → la conducta sube (se repite más).
  • C = Castigo → la conducta baja (se repite menos).
  • P (Positivo) = sumar algo al ambiente.
  • N (Negativo) = restar/quitar algo del ambiente.
  • Ojo: "negativo" NO significa "malo". Refuerzo negativo es bueno para la conducta (la sube), porque quita algo aversivo.

Analogía cotidiana · la Skinner box es una vending machine

Imagina una máquina expendedora con una palanca. Si cada vez que tocas la palanca sale una golosina, aprendes rápido: "toco la palanca → sale golosina". Si la golosina sale solo a veces, de forma impredecible, el aprendizaje es igual pero más enganchado: nunca sabes cuándo viene el próximo golpe de suerte, así que sigues tocando.

Eso mismo pasa con el celular: cada like, cada notificación, cada mensaje nuevo es un refuerzo impredecible sobre la conducta de scrollear. Por eso dejar el teléfono es tan difícil. Skinner lo habría predicho sin mirar un celular, porque el programa de refuerzo variable es el más resistente a la extinción, da igual la especie.

Tabla · los 4 tipos de consecuencia

TipoQué cambia en el ambienteEfecto en la conductaEjemplo cotidiano
Refuerzo Positivo (RP)Se suma algo agradableSube ↑Dar un caramelo al niño después de lavarse los dientes.
Refuerzo Negativo (RN)Se quita algo aversivoSube ↑Tomarse una pastilla para que se vaya el dolor de cabeza.
Castigo Positivo (CP)Se suma algo aversivoBaja ↓Recibir una multa por estacionar mal.
Castigo Negativo (CN)Se quita algo agradableBaja ↓Quitar el celular a un adolescente por mala nota.

Programas de refuerzo · cuándo se entrega el refuerzo

Una vez entendidos los 4 tipos, la pregunta es: ¿cada cuánto se entrega el refuerzo? Skinner descubrió que el patrón de entrega cambia enormemente la fuerza y la persistencia de la conducta.

ProgramaCómo funcionaPatrón de respuestaEjemplo clásico
Razón Fija (RF)Refuerzo tras un número fijo de respuestasAlta con pausa post-refuerzoPago por pieza producida en fábrica.
Razón Variable (RV)Refuerzo tras un número variable de respuestasMuy alta y constante · la más resistente a extinciónTragamonedas, pesca, likes en redes sociales.
Intervalo Fijo (IF)Refuerzo tras un tiempo fijoBaja al inicio, sube al final (curva "en concha")Cheque de sueldo semanal.
Intervalo Variable (IV)Refuerzo tras un tiempo variableModerada y constanteRevisar el mail o WhatsApp (nunca sabes cuándo llega algo).

⚡ Dato que el profe repite: el programa RV es el más adictivo

Por eso las redes sociales, los juegos con loot boxes y las apuestas enganchan tanto: el refuerzo impredecible genera la tasa de respuesta más alta y la resistencia a la extinción más fuerte. Si el profe te tira una pregunta sobre cuál programa genera más conducta, la respuesta casi siempre es Razón Variable.

Moldeamiento (shaping) · cómo enseñar conductas nuevas

¿Cómo enseñar a una paloma a picotear una tecla si al principio no lo hace? Skinner resolvió esto con moldeamiento: reforzar aproximaciones sucesivas a la conducta final. Primero se recompensa cualquier movimiento cerca de la tecla; después solo tocar la tecla; después picotearla; después hacerlo rápido. Cada paso se refuerza hasta que se convierte en el nuevo piso para el siguiente.

Esto es lo que hacen los padres con los niños ("dame 5 pasos y te llevo al parque"), los entrenadores con atletas, y los profesores con estudiantes. Casi todo aprendizaje humano complejo es moldeamiento disfrazado.

Trampa de parcial

Error clásico 1: pensar que "refuerzo negativo" es un castigo. NO: "negativo" significa "quitar", y todo lo que sea Refuerzo (sea positivo o negativo) sube la conducta. Tomarse un analgésico es Refuerzo Negativo (quita el dolor) y por eso la conducta de tomar la pastilla se repite.

Error clásico 2: confundir condicionamiento operante con condicionamiento clásico. En Pavlov (clásico) la conducta es elicitada: el perro saliva porque oye la campana, sin decisión. En Skinner (operante) la conducta es emitida: la rata toca la palanca porque operó sobre el ambiente, y eso tiene una consecuencia.

Error clásico 3: creer que Skinner descubrió el condicionamiento operante. En realidad lo formalizó; la idea de "ensayo y error" viene de Edward Thorndike y su ley del efecto (1898). Skinner fue más allá al inventar el método experimental (la caja, el registro acumulativo, los programas).

Mnemotecnia completa

Los 4 tipos · regla del signo y del resultado:

  • RP: +Refuerzo, +Conducta (sumar bueno → sube).
  • RN: -Refuerzo, +Conducta (quitar malo → sube).
  • CP: +Castigo, -Conducta (sumar malo → baja).
  • CN: -Castigo, -Conducta (quitar bueno → baja).

Programas · regla de la inicial:

  • Razón cuenta Respuestas (cuántas hago).
  • Intervalo cuenta Intervalo de tiempo (cuánto espero).
  • Fijo = predecible, Variable = sorpresa.
  • RV es el más resistente a la extinción (likes, tragamonedas, pesca).

Para el parcial

  • Distinguir los 4 tipos de consecuencia (RP, RN, CP, CN) a partir de un caso: qué se suma o se quita y si la conducta sube o baja.
  • Explicar la diferencia entre condicionamiento clásico (Pavlov, elicitado) y operante (Skinner, emitido).
  • Nombrar y describir los 4 programas de refuerzo (RF, RV, IF, IV), y decir cuál genera la tasa de respuesta más alta y más resistente a la extinción.
  • Definir moldeamiento (shaping) y dar un ejemplo cotidiano (enseñar a un niño a atarse los cordones).
  • Reconocer la ley del efecto de Thorndike como predecesora y diferenciar su aporte del de Skinner.
  • Consejo de orden: primero identifica si es operante o clásico; después mira el programa (si aplica); al final asigna RP / RN / CP / CN.

⚡ Repaso en 30 segundos

  • Conducta operante = emitida, voluntaria, opera sobre el ambiente.
  • Refuerzo (R) → la conducta sube. Castigo (C) → la conducta baja.
  • Positivo (P) = sumar. Negativo (N) = quitar.
  • 4 programas: RF, RV, IF, IV. RV es el más adictivo (likes, tragamonedas, pesca).
  • Moldeamiento = reforzar aproximaciones sucesivas a la conducta meta.
  • Trampa: Refuerzo negativo NO es castigo (es quitar algo malo para que la conducta suba).

Fuentes

  • Skinner, B. F. (1938). The Behavior of Organisms: An Experimental Analysis. Appleton-Century-Crofts.
  • Skinner, B. F. (1953). Science and Human Behavior. Macmillan Company.
  • Skinner, B. F. (1957). Verbal Behavior. Appleton-Century-Crofts.
  • Thorndike, E. L. (1898). Animal intelligence: An experimental study of the associative processes in animals. Psychological Review, Monograph Supplements, 2(4), 1-109.
  • Staddon, J. E. R. & Cerutti, D. T. (2003). Operant conditioning. Annual Review of Psychology, 54, 115-144.
  • Domjan, M. (2014). The Principles of Learning and Behavior (7.ª ed.). Cengage Learning. (Manual de referencia estándar sobre condicionamiento operante y clásico, capítulos 4-6.)

⚡ Arcade — ¿prefieres practicarlo jugando? Diagnóstico Relámpago →

Portada de la Guía de Estudio: Condicionamiento Operante de Skinner

Guía de estudio para este tema

Guía de Estudio: Condicionamiento Operante de Skinner

  • 9 páginas
  • 5 preguntas de parcial resueltas
  • Mapa visual del tema

Calzada exactamente con este artículo — no un PDF genérico.

Sin spam, solo material de estudio.