Bridging Decision Problems, Vol. I Definiendo el Problema
Back to SDA site →

Capítulo 4: Decisiones

Bridging Decision Problems, Volume I — Framing the Problem · Warren B. Powell

Todo este libro se basa en la afirmación:

If you want to run a better {anything} you have to make better decisions.

No hace falta decir que, antes de poder abordar el problema de identificar las mejores decisiones, hay que saber qué decisiones se están tomando.

Recuerde del Capítulo 1 que hay dos tipos de “problemas”: los enfocados en métricas y los enfocados en decisiones. Ejemplos de cada uno son:

Si comenzamos con una métrica, nuestro desafío es identificar las decisiones que nos ayudarán a mejorar la métrica. Si comenzamos con las decisiones, entonces el problema es diseñar la métrica. Sin embargo, incluso cuando creemos conocer las decisiones, debemos asegurarnos de no haber pasado por alto ninguna.

Existe una extensa literatura matemática sobre el tema de la optimización de decisiones, pero incluso estos libros carecen de una definición estándar de qué es una decisión. En su lugar, los libros introducen notación como el vector de decisión “$x$,” o control “$u$,” o acción “$a$,” después de lo cual ofrecen ejemplos y esperan que el lector “lo entienda.” Si bien esto funciona para problemas simples, crea una barrera entre el modelo matemático y las aplicaciones reales.

Para aplicaciones complejas como la gestión de cadenas de suministro o la resolución de problemas de salud pública, identificar las decisiones es mucho más desafiante que identificar las métricas. Esto no pretende trivializar la identificación de métricas, pero el concepto de métricas es bien comprendido tanto por los expertos del dominio como por los modeladores. Cuando se les pregunta qué decisiones están involucradas, los ejecutivos de negocios, profesionales médicos, ingenieros y científicos a menudo se quedan con una mirada en blanco. Si bien la palabra “decisión” es familiar para todos, no parece ser un término que utilicen en la resolución diaria de problemas, mientras que todos entienden “métricas” de una forma u otra.

Las decisiones y el idioma inglés

Parece que un buen punto de partida para un capítulo sobre “decisiones” sería ofrecer una definición. Ayuda notar que las definiciones estándar, como las de Webster, incluirán la variedad habitual de significados de una palabra tal como se usa en el idioma inglés. Por ejemplo, ganar un partido de béisbol se denomina un “decision” (decisión). En este libro, solo usamos “decisión” para referirnos a situaciones en las que tenemos un conjunto de opciones, y debemos hacer la mejor elección, lo cual, por supuesto, implica la identificación de métricas de desempeño.

Comenzamos señalando que las decisiones son siempre una forma de información. Ayuda dividir toda la información en tres clases amplias:

  1. Información que ya conocemos en un momento dado. Nos referimos a esta información como el estado de nuestro sistema (más precisamente, el estado de conocimiento).
  2. Información que controlamos y que cambia el estado.
  3. Nueva información que llega y que no controlamos (aunque podamos influir en ella).

La información de las clases (2) y (3) produce una variable de estado actualizada (clase 1). Ahora estamos listos para definir una decisión:

Definición (formal): Una decisión es una clase de información endógenamente controlable.

Así, las decisiones (que están contenidas en las “variables de decisión”) representan información que creamos al nombrar una entre un conjunto de opciones.

Nuestra definición formal requiere mucha carga conceptual para lo que debería ser un concepto muy simple, así que ofrecemos una segunda definición:

Definición (informal): Una decisión es algo que controlamos.

Esta definición evita “clase de información” utilizando “algo,” pero transmite la idea.

Ambas definiciones plantean la pregunta de quién está tomando la decisión, lo cual es inseparable del concepto de decisión. Los modelos matemáticos clásicos evitan esta pregunta, pero es central para el modelado de la mayoría de los sistemas reales.

Dada la importancia de las decisiones en las actividades humanas, no debería sorprender que haya numerosos términos en inglés que capturan el concepto de una elección. La Tabla 4.1 enumera varias palabras que implican hacer una elección en un contexto general. Bajo la columna “Recopilar información” se encuentran términos que surgen al decidir qué experimento realizar, a quién escuchar, qué observar (y así sucesivamente). La columna denominada “Actuar sobre recursos” enumera una variedad de términos que surgen en el contexto de la gestión de recursos (como las personas). Por ejemplo, “promover” implica la decisión de si promover o no a alguien (y a qué nivel).

Esta tabla no pretende ser una lista exhaustiva de palabras que implican una elección, pero sugiere que las “decisiones” se presentan de muchas formas en el idioma inglés.

Tabla 4.1. El idioma inglés ofrece una variedad de palabras que todas significan la libertad de elegir.
Términos generalesRecopilar informaciónDecisiones de identificaciónActuar sobre recursos
AcciónExperimento (¿cuál?)IdentificarPromover (a quién, cuánto)
ElecciónEscuchar (¿qué?)ClasificarAdquirir (cuál, cuánto)
ControlObservarHallazgoVender (a quién, cuánto)
DecisiónProbar (cuál)ConcluirRecompensar (cuánto)
DiseñoVer/escanearEtiquetarCriticar (a quién, cómo)
Intervención (médica)Mover (a dónde)
OpciónComerciar (cuál, con quién)
Mover (a dónde)Tratamiento (cuál)
Respuesta (cuál)Aceptar/rechazar
TareaRecomendar
Operación (finanzas)

Identificación de decisiones

Comprender las diferentes palabras que implican (o requieren) hacer una elección es importante al identificar las decisiones que están disponibles para tomarse. Es importante reconocer que las decisiones no vienen con etiquetas brillantes adheridas a ellas. Campbell’s Soup Co. reconoció el desafío de hacer que los consumidores fueran conscientes de que estaban tomando decisiones en una famosa serie de comerciales en los años 1970, con el eslogan “¡Podría haber tomado un V8!”. Su departamento de marketing se dio cuenta de que las personas a menudo tomaban una lata de gaseosa sin darse cuenta de que podrían haber elegido tomar un V8 en su lugar. Los comerciales ayudaron a que los consumidores fueran conscientes de que beber una gaseosa era una decisión.

Las personas, en casi cualquier contexto de problema, caen en el hábito de resolver los problemas de una determinada manera, sin darse cuenta de que tienen opciones. Podría decirse que así es como logramos avanzar en el día, ya que evaluar las opciones para identificar la mejor toma tiempo. El desafío que enfrentamos es primero ser consciente de cuándo estamos tomando una decisión, y luego identificar las decisiones que tienen el mayor impacto en el desempeño.

El comportamiento de tomar decisiones de manera pasiva es absolutamente generalizado, pero esto crea una oportunidad. Imagine que se encuentra en cualquier contexto de problema (como los ilustrados a la izquierda en la figura 4.1). Ahora suponga que quiere mejorar el desempeño, ya sea la rentabilidad, la productividad, mejores resultados de salud, mejores medicamentos, o mejorar la agricultura. Entonces recuerde nuestra frase básica:

Si quiere dirigir un mejor {lo que sea}, tiene que tomar mejores decisiones.

Para tomar una mejor decisión, hay que reconocer cuándo se está tomando una decisión. Un buen ejercicio es crear su “libro de decisiones” y luego tomar notas mentales a medida que reconoce cuándo se está tomando una decisión (es decir, hubo una elección, y podrían haberse tomado diferentes decisiones).

A challenge is to work in any of a variety of problem settings and identify the decisions that are being made.
Figura 4.1. Un desafío es trabajar en cualquiera de una variedad de contextos de problemas (como los de la derecha) e identificar las decisiones que se están tomando.

Tipos de decisiones

Nuestro enfoque de encuadre requiere poder identificar todas las decisiones, no solo las decisiones que pueden ser abordadas por una metodología particular. Para guiar este proceso, enumeramos a continuación 10 tipos de decisiones que, según nuestro conocimiento, cubren toda forma de información que controlamos.

  1. Decisiones físicas y financieras – Estas decisiones surgen en la gestión de recursos físicos y financieros, abarcando personas, equipos, instalaciones, productos, materias primas, agua, energía, además de efectivo, inversiones, préstamos, … Las decisiones incluyen comprar, vender, mover y modificar recursos. Esta clase es el dominio de la investigación de operaciones, el control de ingeniería y las finanzas, y se basa en gran medida en herramientas como la programación lineal, entera y no lineal.
  2. Elecciones discretas con resultados incertidos – Este es un término general diseñado para cubrir actividades que pueden involucrar proyectos complejos como lanzar un nuevo producto, presentar un medicamento para ensayos clínicos, o adquirir una empresa. A veces llamados “proyectos,” estos pueden involucrar una serie de cambios en las métricas de desempeño, los recursos, las finanzas y la dinámica del sistema. Los casos especiales pueden ser problemas más simples, como elegir un precio o a quién contratar para un puesto de liderazgo. Estos problemas son populares en la literatura de análisis de decisiones, y típicamente involucran conjuntos relativamente pequeños de acciones que son difíciles de evaluar.
  3. Decisiones de adquisición/observación de información – Estas incluyen decisiones para adquirir u observar información mediante la realización de experimentos en el laboratorio, en el campo, o con simulaciones informáticas. Ayuda distinguir dos contextos en los que podemos adquirir información:
    • Aprendizaje fuera de línea (offline) - Estas son actividades que se llevan a cabo en un entorno de prueba. La adquisición de información fuera de línea puede incluir esfuerzos de investigación, búsquedas en internet, o la contratación de expertos del dominio.
    • Aprendizaje en línea (online) - Esto cubre decisiones para ejecutar y observar procesos en el campo utilizando un enfoque de “aprender haciendo,” que implica observar un proceso a medida que evoluciona, como la forma en que un mercado responde a la publicidad o a los precios, o cómo un paciente responde a un tratamiento.

Ambos estilos de adquisición de información implican tomar decisiones específicamente para adquirir información. La adquisición de información se ha estudiado bajo nombres como diseño de experimentos (estático o secuencial), búsqueda estocástica, aprendizaje activo (u óptimo), bandidos multibrazo (multiarmed bandits) y optimización bayesiana.

  1. Decisiones de comunicación/compartición de información – Estas se presentan en dos formas:
    • Mensajería – Esto refleja lo que decimos en texto, video y/o audio. Un ejemplo moderno de mensajería incluye la optimización de prompts.
    • Canales y momento – Esto refleja la elección del canal (texto/correos electrónicos, publicación (impresa o en línea), redes sociales, o canales publicitarios) junto con el momento y la frecuencia.
  2. Métricas de desempeño y objetivos - Estas representan la elección crítica de cuantificar lo que estamos tratando de lograr, como maximizar los ingresos, minimizar los costos, maximizar la resistencia de un material o el desempeño de un medicamento, o minimizar las millas vacías. Estas se pueden incorporar en la función objetivo o representarse como restricciones.
  3. Elección de funciones – A menudo pasada por alto como una decisión, las funciones pueden ser métodos para tomar decisiones (políticas), la formulación de modelos de optimización, la elección de métricas de desempeño, métodos para pronosticar o estimar, o funciones de transición (como la manera en que se propaga una enfermedad). Esta categoría cubre la elección de la función, lo que significa su estructura.
  4. Fijación de parámetros – Las funciones típicamente se caracterizan por uno o más parámetros (generalmente continuos, pero no siempre) que pueden ajustarse para mejorar la precisión predictiva (al ajustar modelos estadísticos) u optimizarse para mejorar el desempeño (al afinar una política para tomar decisiones). Los parámetros pueden estar asociados con una función; pueden ser el peso de una métrica de desempeño, o pueden ser un objetivo (o límite) para una métrica de desempeño.
  5. Estimación o identificación – Se nos puede dar la imagen de una persona y pedirnos que la identifiquemos, donde queremos maximizar el número de veces que identificamos correctamente a la persona. A un modelo de lenguaje grande se le da un conjunto de palabras (en realidad, tokens), y trata de identificar la palabra (o token) más probable que sigue a continuación.
  6. Características y comportamientos - Podríamos elegir las características de un nuevo paquete de software, el diseño de un nuevo producto, o cómo elegimos comportarnos (como individuo, organización o cuerpo político).
  7. Decidir qué decidir - En la mayoría de las aplicaciones reales, el número de decisiones potenciales (es decir, cualquier lugar donde enfrentamos una elección) puede ser bastante grande. Debemos priorizar qué decisiones tienen el mayor valor económico para justificar la realización de cualquier análisis formal.

Tipos de variables de decisión

Las decisiones vendrán en diferentes estilos, pero las variables de decisión típicamente se pueden ubicar en una (o más) de las siguientes categorías:

Cómo las decisiones impactan el sistema

No tiene sentido hablar de “decisiones” como un concepto abstracto. Primero reconocemos que una decisión cambia el sistema de alguna manera, pero ¿cómo?

Hay tres formas en que una decisión puede impactar un sistema:

Hay algo de superposición en las categorías, como la distinción entre las coberturas de divisas y los términos de un contrato de venta. Lo importante es la amplitud de formas en que podemos afectar cómo evoluciona un sistema a lo largo del tiempo.

A medida que avanzamos en nuestro marco de modelado, necesitaremos entender lo siguiente sobre cualquier decisión:

En el Volumen II describimos estos puntos usando notación matemática.

Momento de las decisiones

Uno de los atributos más importantes pero desafiantes de las decisiones involucra el tiempo, específicamente:

Quién toma las decisiones

Hay muchos entornos donde hay más de un tomador de decisiones (o agente). Ejemplos de entornos multiagente incluyen:

Volvemos a los problemas multiagente más adelante en la serie, donde mostramos cómo extender la notación (presentada en el Volumen II) para manejar múltiples tomadores de decisiones. Por ahora, nos vamos a enfocar en un único tomador de decisiones, que puede ser uno de dos o más tomadores de decisiones.

Tenemos varias razones para evitar la identificación explícita de los tomadores de decisiones en esta etapa:

Por ahora, cuando se enfrenta a un entorno multiagente recomendamos tratar cada agente por separado para identificar sus propias métricas y decisiones. Las incertidumbres a menudo afectan al entorno más amplio, aunque cada agente puede tener incertidumbres que son relevantes para sus propias decisiones y métricas de desempeño.

Tomar decisiones con computadoras

Las computadoras tienen una forma muy directa de tomar decisiones. Comienza conociendo los tipos de decisiones y el conjunto de decisiones posibles (factibles). Luego utiliza un método preespecificado para “tomar” la decisión, lo que significa una elección particular del conjunto de decisiones factibles (o permitidas).

Comenzamos presentando cómo nos referimos a estos métodos de toma de decisiones:

Definición: Una política es un método para elegir una decisión permitida usando la información que está disponible en el momento en que se toma la decisión.

Hay dos estrategias amplias para diseñar políticas, cada una de las cuales se puede dividir en dos clases, creando cuatro clases de políticas que incluyen cualquier método para tomar decisiones. Estas son:

Búsqueda de políticas - Esta estrategia crea funciones que deben ajustarse para funcionar bien a lo largo del tiempo. Toman decisiones sin planificar directamente hacia el futuro. Estas pueden dividirse en dos clases:

  1. Aproximaciones de función de política, o PFAs.
  2. Aproximaciones de función de costo, o CFAs.

Políticas de anticipación - Esta estrategia intenta tomar la mejor decisión ahora optimizando sobre el desempeño de la decisión actual, más una aproximación del impacto de la decisión actual sobre el futuro. Estas también pueden dividirse en dos clases:

  1. Políticas basadas en aproximaciones de función de valor, o VFAs.
  2. Aproximaciones de anticipación directa, o DLAs.

Cada una de estas políticas se describe a continuación.

Aproximaciones de función de política (PFAs)

Las aproximaciones de función de política (PFAs) representan cualquier función analítica que, dadas las entradas de lo que sabemos, produce como salida la acción que debemos tomar. Algunos ejemplos son:

Las PFAs pueden ser cualquier función analítica, como una función lineal o no lineal. Lo que una PFA no puede incluir, lo cual se encontrará en cada una de las tres clases restantes de políticas, es un problema de optimización incrustado. Las PFAs pueden ser reglas simples, pero también pueden ser funciones no lineales de muy alta dimensionalidad, como una red neuronal.

Aproximaciones de función de costo (CFAs)

Existen muchos problemas donde el mejor enfoque para tomar decisiones es utilizar una aproximación determinista en un momento dado que ha sido modificada usando varios parámetros que, cuando se ajustan adecuadamente, producen decisiones que funcionan bien a lo largo del tiempo. Este es un enfoque ampliamente utilizado en la práctica, aunque a menudo sin reconocer a) la capacidad de introducir parámetros para ayudar a mejorar las decisiones y/o b) el hecho de no reconocer que los parámetros pueden ajustarse para producir mejores resultados.

El ejemplo más simple de este enfoque se ilustra en la figura 4.2, donde necesitamos elegir qué producto anunciar en redes sociales (podríamos sustituir cualquier problema con opciones discretas listadas en la sección de prueba y error inteligente del Capítulo 2). Tenemos una estimación puntual del valor de cada producto basada en la experiencia pasada, la cual hemos aprendido que puede involucrar mucho ruido, resultando en algunas estimaciones deficientes. También podemos usar la experiencia pasada para estimar una desviación estándar, que es una medida de la dispersión de la incertidumbre. Típicamente estamos 95 por ciento seguros de que la verdad está dentro de más o menos 2 desviaciones estándar.

Cuando se enfrenta a un conjunto discreto de opciones, la incertidumbre en la creencia sobre el desempeño de cada una puede describirse mediante su valor promedio y su desviación estándar.
Figura 4.2. Cuando se enfrenta a un conjunto discreto de opciones, la incertidumbre en la creencia sobre el desempeño de cada una puede describirse mediante su valor promedio, y la desviación estándar que captura la dispersión de la creencia.

Lo que vamos a hacer es crear un “índice” para cada producto $x$ dado por:

\[Index_x = \text{Avg.value}_x + \theta \,(\text{std.dev}_x)\]

Luego vamos a elegir anunciar el producto $x$ que tenga el valor más alto de “$Index_x$”. Encontramos el producto $x$ resolviendo el siguiente problema de optimización (que es determinista):

\[\max_x \{\text{Avg.value}_x + \theta \,(\text{std.dev}_x)\}\]

Resolver este problema de optimización es bastante simple: solo tenemos que ordenar los valores $\text{Avg.value}_x + \theta (\text{std.dev}_x)$ y encontrar el producto $x$ que tenga el valor más alto (¡y aquí pensabas que la optimización determinista tenía que ser difícil!).

El desafío, entonces, es elegir el parámetro ajustable $\theta$. Si usamos $\theta = 0$, eso significa que simplemente estamos usando nuestra estimación actual. El problema es que si nuestra estimación “$\text{Avg.value}_x$” es baja debido a una racha de mala suerte, podríamos nunca volver a intentar anunciar el producto $x$. Si usamos $\theta = 2$, entonces estamos usando una estimación muy optimista del valor del producto $x$, lo cual fomentará probar productos donde hay un alto nivel de incertidumbre (lo cual no es necesariamente una mala estrategia).

La idea de usar una aproximación determinista parametrizada es excepcionalmente poderosa. Las aerolíneas la usan cuando optimizan sus horarios, donde tienen que usar una estimación de los retrasos por clima para cada vuelo. Si usan la mediana, entonces la mitad de las veces el retraso será mayor de lo anticipado por el horario, lo cual producirá un gran número de llegadas tardías de aeronaves, retrasando los vuelos subsiguientes. Sin embargo, si usamos el percentil 90, entonces podríamos estar introduciendo demasiada holgura en el horario, resultando en una mala utilización de las aeronaves.

Es más fácil pensar en ajustar un conjunto de parámetros $\theta$ en un simulador, pero a menudo ocurre (como en el problema de programación de horarios de aerolíneas) que el problema es demasiado complicado. Por esta razón, puede ser necesario hacer aprendizaje en línea, lo que significa probar diferentes valores en el campo y observar el desempeño real.

Aproximaciones de función de valor (VFAs)

Imagine que estamos despachando una flota de camiones donde tenemos que asignar conductores para mover las cargas de mercancía desde un lugar de recogida hasta un lugar de entrega. La figura 4.3 ilustra cómo este problema debe resolverse repetidamente a lo largo del tiempo. Lo que decidamos hacer el lunes cambiará las ubicaciones de los conductores el martes y el miércoles. Cada día, los transportistas llaman con nuevos conjuntos de cargas que no se conocen de antemano, por lo que la empresa transportista debe tomar decisiones de asignación el lunes sin saber qué sucederá el martes o el miércoles.

Ilustración del problema de asignar camiones durante un período de tres días.
Figura 4.3. Ilustración del problema de asignar camiones durante un período de tres días.

Optimizar sobre un horizonte de múltiples días en presencia de las incertidumbres es una tarea increíblemente compleja. En su lugar, podemos aproximar el valor de los conductores en el futuro, como se muestra en la figura 4.4. Esto puede hacerse ejecutando simulaciones hacia el futuro, y luego calculando el valor de los conductores en diferentes ubicaciones. Cuando incluimos estos valores (llamados “aproximaciones de función de valor”), el problema que ahora tenemos que resolver el lunes no es más complicado que si ignoráramos por completo el impacto de enviar conductores a diferentes ubicaciones.

Asignación de conductores a cargas utilizando estimaciones del valor de los conductores en el futuro.
Figura 4.4. Asignación de conductores a cargas utilizando estimaciones del valor de los conductores en el futuro.

Aproximar el valor de aterrizar en un estado particular es una estrategia muy popular en la literatura de investigación, pero su éxito depende en gran medida de la estructura de un problema particular, y tiende a funcionar bien para un pequeño número de problemas con estructuras especiales.

Aproximaciones de anticipación directa (DLAs)

Existen muchos problemas donde simplemente tenemos que planificar hacia el futuro para tomar una decisión ahora. Uno de los ejemplos más familiares de una política de anticipación directa es cuando usamos Google maps para planificar una ruta hacia el destino.

Las políticas DLA pueden dividirse en dos subclases:

Note que no necesitamos subdividir las anticipaciones deterministas ya que, incluso si la decisión en cada período de tiempo es un escalar, todo el modelo de anticipación requiere optimizar sobre el vector de decisiones que abarca los períodos de tiempo a lo largo del horizonte de planificación.

Ruta planificada por Google maps basada en tiempos de viaje estimados (izquierda); ruta alternativa basada en el riesgo percibido de conducir a través de la ciudad de Nueva York (derecha).
Figura 4.5. Ruta planificada por Google maps basada en tiempos de viaje estimados (izquierda); ruta alternativa basada en el riesgo percibido de conducir a través de la ciudad de Nueva York (derecha).

La figura 4.5 (izquierda) muestra un ejemplo de Google maps planificando una ruta desde Hartford, Connecticut (arriba a la derecha) hasta Princeton, Nueva Jersey (abajo a la izquierda), saliendo a las 4pm de la tarde. Note que la ruta pasa justo por la ciudad de Nueva York, lo cual ocurriría justo alrededor de las 5pm cuando se espera que el tráfico sea más intenso. Google maps usa una estimación puntual, y aun así considera que esta es la ruta más corta.

Por supuesto, cualquier viajero con conocimiento entendería que existe una tremenda incertidumbre en torno a los tiempos de viaje reales a través de Nueva York a las 5pm. La figura 4.5 (derecha) muestra una ruta alternativa que Google proporciona, dándole al viajero la oportunidad de elegir entre una ruta que se espera sea más corta, pero con el riesgo de ser mucho más larga, frente a una ruta ligeramente más larga que se espera esté cerca del tiempo que Google estima.

La primera ruta, entonces, es un ejemplo de una anticipación determinista, pero el usuario puede introducir la incertidumbre al evaluar la recomendación. Al elegir la segunda ruta, estamos resolviendo, de una manera admitidamente ad hoc, una anticipación estocástica.

Cuando estamos planificando hacia un futuro incierto, existe una amplia gama de estrategias para modelar este proceso y ayudar a tomar una decisión ahora. Una estrategia es usar un pronóstico puntual (es decir, una anticipación determinista) pero introducir parámetros ajustables que puedan hacer la solución más robusta.

Políticas híbridas

Además de las cuatro clases de políticas, podemos crear una variedad de híbridos que combinan dos, tres o incluso las cuatro clases. Algunos ejemplos usando un entorno de cadena de suministro son:

Si bien estas políticas pueden sonar complicadas, es posible describir escenarios específicos donde la toma de decisiones humanas está usando cada una de ellas. Por ejemplo, la política más compleja usa una anticipación estocástica, la cual ilustramos anteriormente usando el problema de navegación con Google maps, donde se eligió una ruta más larga para evitar el riesgo de congestión en la ciudad de Nueva York.

¿Qué políticas son las más utilizadas?

Discutir sobre políticas puede sonar complicado y confuso. Es importante recordar que:

Comencemos dividiendo la cuarta clase, DLAs, en dos tipos: anticipaciones determinísticas y anticipaciones estocásticas. Luego vamos a dividir el último tipo, anticipaciones estocásticas, en dos subtipos: problemas donde las decisiones son una de un conjunto de opciones discretas, y problemas donde las decisiones son vectores, tales como asignaciones de activos entre inversiones, o la asignación de máquinas a tareas.

Esto nos da seis tipos de políticas que dividimos en cuatro categorías:

Categoría 1 - Esta categoría incluye tres tipos de políticas:

Las CFAs y las Det-DLAs implican ambas resolver problemas de optimización determinísticos; la única diferencia es que las CFAs no planifican hacia el futuro, mientras que las DLAs sí lo hacen.

Categoría 2 - Políticas de anticipación estocástica donde las decisiones son opciones discretas. Aquí modelamos explícitamente la incertidumbre en la evaluación de cada opción. Estas se estudian ampliamente usando el recurso de los árboles de decisión.

Categoría 3 - Políticas basadas en aproximaciones de función de valor, donde una decisión ahora considera el costo o recompensa inmediata más una estimación del valor futuro de transicionar a algún estado. Esta es una clase avanzada y computacionalmente difícil de políticas que se necesitan para un pequeño conjunto de problemas especializados.

Categoría 4 - Políticas de anticipación estocástica donde las decisiones son vectores. Esta es una clase de problemas muy compleja que requiere estrategias complejas, ya que una anticipación estocástica es simplemente otro problema de optimización estocástica, con simplificaciones introducidas para reducir la complejidad computacional.

Las políticas de la categoría 1 son usadas por todos, independientemente de su formación formal. Estas políticas son las más simples, pero esto requiere la introducción de parámetros que hay que ajustar, lo cual puede ser difícil.

Los cerebros humanos han desarrollado la capacidad natural de usar las cuatro clases de políticas, al menos en el contexto de opciones discretas. Incluso sabemos cómo cambiar entre las clases sin darnos cuenta. Si estamos jugando ajedrez (y tenemos algo de experiencia con el juego), probablemente estamos haciendo los primeros movimientos de memoria (los jugadores expertos son capaces de ejecutar bastantes movimientos de memoria). Esto es una PFA pura. Sin embargo, en algún momento empezamos a pensar en lo que podría hacer nuestro oponente, lo cual implica una política de anticipación directa, típicamente combinada con VFAs que pueden capturar el valor de perder piezas importantes.

Ejercicios

Preguntas de repaso

  1. Dé la definición formal de una decisión, la definición informal, y tres ejemplos de decisiones.
  2. Explique qué se entiende por una "clase de información controlable endógenamente." ¿Cuáles son las otras dos clases de información que se describen en el mismo contexto?
  3. Dé ejemplos de decisiones que caigan en cada una de las siguientes categorías:
    1. Binaria.
    2. Un conjunto de opciones discretas con al menos cinco opciones.
    3. Hay al menos 10,000 decisiones diferentes que deben tomarse en un momento dado.
  4. Nombre cinco ejemplos de decisiones continuas.
  5. Dé tres ejemplos de cada uno de los tres tipos de decisiones:
    1. Decisiones que impactan recursos físicos.
    2. Decisiones que impactan recursos financieros.
    3. Decisiones que impactan la recolección o distribución de información.
  6. Nombre tres contextos donde las decisiones deben tomarse en diferentes escalas de tiempo. Describa el contexto y el momento de las decisiones.
  7. Resuma con sus propias palabras las cuatro clases de políticas, y dé un ejemplo de cada una para algún contexto de problema.

Preguntas de modelado

  1. Dé un ejemplo de una decisión que caiga en cada categoría:
    1. Una decisión que debe tomarse cada minuto (o más rápido).
    2. Una decisión que debe tomarse diariamente.
    3. Una decisión que debe tomarse anualmente.
  2. Identifique las decisiones implícitas en cada contexto, y el tomador de decisiones que toma cada decisión.
    1. Un individuo tiene que tomar la medicación prescrita por su médico, quien sigue protocolos elaborados por los desarrolladores del medicamento.
    2. La red eléctrica tiene que indicarle a una compañía de servicios públicos qué plantas de vapor encender, y cuándo. Las decisiones de programación se toman mediante un modelo de computadora ejecutado el día anterior.
    3. El gestor de un fondo mutuo tiene que decidir cuánto efectivo mantener disponible para responder a depósitos y solicitudes de rescate de inversionistas individuales (montos pequeños) e inversionistas minoristas (montos grandes).
  3. Dé tres ejemplos de aproximaciones de función de política. Describa el contexto y cómo funcionaría la PFA.
  4. Dé un ejemplo de una aproximación de función de costo para un problema de elección discreta.
  5. Está usando Google maps para encontrar una ruta que le permita llegar al trabajo a las 8:30am. También tiene que decidir cuánto tiempo dejar de margen para llegar a tiempo. Describa las decisiones que se están tomando, y qué tipo de política se está usando para tomar cada una.
  6. Describa tantas clases de políticas como se le ocurran que podría usar si fuera a diseñar un programa de computadora para jugar ajedrez. Describa cómo se aplicaría cada clase de política que haya identificado.