Bridging Decision Problems, Vol. I 界定问题
Back to SDA site →

第3章:性能指标

Bridging Decision Problems, Volume I — Framing the Problem · Warren B. Powell

管理学中有一句古老的格言:

“你无法管理你无法衡量的东西。”

每当我们希望改进某个流程或系统的绩效时,重要的是要有一个明确定义的绩效指标,同时也要认识到通常会存在多个指标。在我们开始讨论与指标相关的复杂问题之前,我们必须首先承认,有大量问题并没有明确定义的指标,比如与谁结婚、大学毕业后从事什么工作,或者选择购买哪幅画或哪座雕塑。如果你难以确定至少一个可清晰量化的指标,那么你的问题很可能属于人类决策问题这一复杂领域,而这类问题无法从分析性思维中获益。

但如果你能确定至少一个明确的、可量化的指标,请继续阅读。

指标的类别

指标的范围非常广泛,因此尝试确定指标的主要类别会有所帮助。一些较为常见的类别包括:

  1. 财务指标 - 这些指标包括任何以货币衡量的指标。它们可以按以下方式衡量:
    • 总量 - 现金持有量、贷款担保、投资。
    • 单位时间(天、月、季度、年),通常代表成本、收入或利润。
    • 单位资源 - 每人、每台机器、每个设施或每股的美元数。
  2. 生产率指标 - 这些是非以美元计价的指标,也可以按单位时间(诊治的病人数、生产的单位数、行驶的里程数)和单位资源(每人、每台机器、每个设施)来衡量。
  3. 有效性指标 - 材料的强度、药物的疗效、制造过程的产出率、机器的平均故障间隔时间。
  4. 服务绩效 - 我们服务市场或外部主体的效果如何,例如覆盖的需求、客户的满意度评分、学生的安置情况。
  5. 外部绩效评级 - 学校的排名、公司产品的可靠性、销售排名、医院的评级。
  6. 行为指标 - 实际决策与预定方向或指导方针之间的偏差。
  7. 估计指标 - 我们对数量(未来需求、降雨量、库存量)或参数(患者诊断、生产成本)的估计或预测有多准确。这些假设我们有某种方法可以将先前的估计与实际表现的观察结果进行比较。

评估每一类指标有两种方式:

平均绩效与风险指标将在下文中进一步讨论。

提供一些具体的例子会有所帮助。以下列出了来自不同类别的指标。

指标金字塔

编制指标清单是很常见的做法,尤其是在商业领域,这些清单可能相当长。对指标进行优先级排序非常重要,这可以通过将它们组织成金字塔的形式来相对容易地完成,如图 3.1 所示。图 3.1(a)展示了公司最高层级人员(通常称为”高管层”)可能使用的一套潜在指标,其中最重要的目标是最大化季度股价。然而,这些指标并不能为在制造工厂工作的人员提供太多指导,对他们而言,最重要的指标可能是成本,紧随其后的是产量和质量。图 3.1(b)展示了如何为可能在制造业工作的人员创建一个不同的金字塔,其中更强调成本。

指标组织成金字塔在很大程度上是主观的,但顶部应该只有一个被认为是最重要的指标。顶部的指标应该是一个要么被最大化要么被最小化的指标,但其他所有指标未必都是如此,这一问题我们将在下文讨论。

一家上市公司高管层级可能使用的指标金字塔。
(a)
一家制造工厂可能使用的指标金字塔。
图 3.1. (b) — (a) 一家上市公司高管层级可能使用的指标金字塔。(b) 一家制造工厂可能使用的指标金字塔。

目标、指标值与限制

接下来我们需要明确对每个指标我们试图达成什么目标。使用指标来评估绩效有三种方式:

尽管衡量绩效的方式可以有所不同,但最终计算机必须能够审视一组决策并选出最优的那一个。

处理多重目标

通常存在多个需要最大化或最小化的目标。尽管关于多目标优化有大量文献,但最终有必要将这些指标组合成一个单一的效用函数,这就需要为每个指标分配权重。金字塔顶部的指标(往往是需要被最大化或最小化的那个)通常作为基准,而其他指标则相对于顶部指标进行加权。

当必须将多个指标组合成一个单一的效用函数时,就会出现如何对它们加权的问题。我们建议将金字塔顶部指标的权重设为1.0,这意味着其他指标(它们未必与顶部指标使用相同的单位)的权重必须相对于顶部指标进行缩放。最初这些权重可以主观设定,但最终会形成一组决策,这些决策会在每个被最大化或最小化的维度上产生一定的绩效水平。如果领域专家对某个维度上的绩效不满意,通常的做法是调整权重,然后在看到新的一组决策后重新评估。

平均绩效与风险

如果我们运行20次模拟来评估某种做决策的流程,我们是基于平均绩效来评估我们的方法。如果我们可以使用模拟器,我们就可以这样做,但另一种方法是仅仅观察它在实际场景中运行一段时间的表现。在这种情况下,我们是在跟踪单一样本的观察结果,并用实际表现来评估我们的方法。我们可以说,观察实际表现就像只对一个观察值取平均。

现场的实际表现是我们所经历的。对于公司而言,这体现在其损益表中,以及总结其他绩效指标的各种报告中,例如各种财务关键绩效指标(KPI),以及关于库存和设施设备利用率的统计数据。在医疗环境中,我们可能会关注新增感染或用药过量死亡的平均比率。酒店会关注客房利用率和收入。整车运输车队会收集关于每位司机收入和空驶里程的统计数据。

现在,考虑公司正常运营中突然出现中断的问题。可能是地震或海啸摧毁了一个主要的制造工厂,或者是像COVID这样的疾病出现,扰乱了消费模式。也可能爆发关税战,严重扰乱全球贸易。

我们已经在第2章中认识到不同不确定性来源的存在,那么为什么我们要特别关注这些新的不确定性来源呢?难道不是这样的情况吗:如果这些重大事件之一发生,其影响将在我们随时间累积绩效指标时被捕捉到?

简单的答案是:不会。设想供应链发生重大中断,导致我们必须经历一段无法服务市场的时期。最重要的是,我们可能会因为竞争对手而流失客户,因为他们可能不愿意等到问题解决。此外,由于没有运转工厂所需的零部件,我们可能不得不让大量员工休假。这对员工来说是一种困境,会导致不满情绪,而最优秀的员工可能会找到更好的工作。

这些问题并未被追踪企业绩效的常规会计流程所捕捉。正是出于这个原因,市场上出现了大量书籍来探讨通常被称为”风险”(或”韧性”,指企业从重大事件中恢复过来的能力)的话题,如图 3.2 所示。这些书籍通常是对不同类型风险的定性描述,往往(但并非总是)没有处理风险的正式流程。

A sample of books on supply chain risk and resilience.
图 3.2. 一些关于供应链风险与韧性的书籍样例。

风险是一个通常在不确定条件下必须做出决策时使用的术语。在第 2 章的应用背景下可能出现的风险示例包括:

这些事件根本无法通过累积常规的绩效统计数据得到恰当的体现。因此,有必要将这些可能概率极低的事件与平均或实际绩效分开加以考量。

电网的管理提供了一个很好的例证。管理电网的公司被要求调度足够的电力以应对其最大发电机组(可能是核电站)发生故障的情况,这种故障会造成停电。这里并不试图量化停电的经济影响。相反,他们只是将其归入一个单独的类别,并要求系统能够应对一次重大停机事故。

关于风险的文献大致可以分为两类:

第一类文献,即图 3.2 中所展示的那类书籍,用通俗易懂的语言描述大多数人普遍认同应予避免的风险事例。第二类文献则由通常高度理论化的书籍和论文构成,但它们将风险的刻画局限于明确定义的概率分布的极端值。

令人意外的是,这两类文献都没有提供一个可广泛适用于风险问题所涉及的各种情境的、可称为正式定义的风险定义。我们在此提出这样一个定义,但首先要为我们最初的目标提供一个正式的名称,该目标基于对我们流程的仿真,无论是在模拟器中还是在实地中:

基础目标(The base objective)——这是我们通过正常累积绩效指标(包括但不限于损益表)来评估我们的决策流程在实地随时间推移的表现的方式。对于企业而言,这通常(但并非总是)以货币单位衡量,但也可能是公共卫生场景中的死亡人数、货运公司每位司机的载重里程,或者总统选举中的选票数。

现在我们准备给风险下定义:

风险(Risk)——风险包含两个维度:

在大多数应用中,风险作为其自身的度量被捕捉,可能是超过某个限值的电力中断、可能导致停产的零部件供应下降,或导致严重健康后果的事件。多数情况下,目标是将风险控制在用户指定的限值以下(我们假设我们始终致力于降低风险度量)。

有趣的是,关于风险的数学文献通常使用一个可调节的风险参数,将基础目标和风险度量合并为一个单一的效用函数。尽管这可能是合并两个度量的一种有效方法,但我们尚未准备好做出这一假设。

我们注意到,基础目标始终是一个平均值或平均值的抽样估计,而风险度量往往并非作为平均值(或期望值)计算得出,而是作为一个可能发生的事件,其概率甚至可能完全未知。

某一时间点 vs. 随时间推移

关于随时间推移做出决策的问题,存在着大量文献。库存管理显然是一个必须随时间求解的问题,需要在库存持有成本与随着新订单信息的出现而可能发生缺货之间进行权衡。但是,如果我们面对的是将司机分配给货运任务的问题,或是平衡投资组合,或是决定在哪里建仓库呢?在20世纪50年代,在单一时间点求解这些问题中的任何一个都是一项重大挑战。

如今,我们拥有能够快速求解这些问题(即便是大规模实例)的软件包,但这仍然留给我们一个挑战,即如何做出随时间推移都能表现良好的决策。例如,将一名司机分配到一个前往蒙大拿州(一个非常偏远的地方)的货运任务,会在该司机完成任务后需要寻找下一个货运任务时产生问题。我们必须考虑我们是否甚至想要接受移动这批货物的请求,如果接受,又该分配哪位司机来完成?求解一系列分配问题的过程如图 3.3 所示。我们的股票投资组合必须在资产价格随时间波动的情况下依然表现良好,而仓库选址则必须预见未来的需求模式。

在本书撰写之时,我们已理解库存问题必须随时间进行优化。然而,专注于复杂问题优化模型的学术群体,例如司机分配问题、投资组合管理问题以及仓库选址问题,每一个都必须体现新信息的影响,以及当前决策对未来的影响。我们拥有强大的软件包可以在某一时间点求解这些问题,但却没有任何工具可以随时间优化绩效。

The assignment problem has to be solved repeatedly, and decisions made at one point in time have an impact on future problems.
图 3.3. 此处我们说明了这样一个现实:分配问题必须被反复求解。此外,在某一时间点做出的决策会对未来的问题产生影响。

当我们面对必须反复求解的问题时,我们必须捕捉:

新信息的到来在随时间做出决策时引入了一个重大的复杂性(事实上,几乎所有随时间求解的问题都必须在新信息出现的情况下进行)。例如,在我们的分配问题中,新信息可能是待运送的新货运任务的到来。周二需要运送的新货运任务在我们周一做决策时是未知的。因此,如果我们在周一分配司机,那么周二可能呼叫进来的货运任务是不确定的。我们也可以说未来将被呼叫进来的货运任务是”随机的”(数学建模领域更偏好使用”stochastic”这一术语)。

对于优化司机与货运任务分配的问题,我们必须捕捉新货运任务的到来,以及前几天的司机分配情况如何影响司机今天的状态。为了评估绩效,我们会运行一次仿真,其步骤包括:

现在设想我们从周一重新开始,再次完整地重复整个过程,但在向前推进的过程中,我们对不同的一组被呼叫进来的货运任务进行抽样。这意味着我们可以对随时间做出决策进行仿真,并且会得到完全不同的结果。

存在着多种可能考虑到当前决策对未来影响的、将司机分配给货运任务的决策方式。设想我们有三种方法。我们可以通过反复运行仿真然后取平均值来评估每一种方法。例如,我们可能针对每种决策方法执行 20 次仿真,并使用这个平均值来评估这些方法。

涉及随时间做出决策的问题是司空见惯的;事实上,它们可能占决策问题的绝大多数。第 2 章中的每一个应用都是一个序贯决策问题。例如:

令人有些惊讶的是,尽管解决静态决策问题的文献已经非常成熟,但从事这些问题研究的学术界并未采用一套标准框架来建模和求解序贯问题。

我们将在第二卷中使用一些符号来重新讨论这些问题。如果没有符号,讨论就会沦为大量的空泛之谈。

心理性能指标

几乎整个优化文献都假设存在一个明确定义的性能指标,称为目标函数,可用于评估决策。目标函数可能并非精确已知,但我们假设其不确定性可以被量化,或至少可以被采样。相比之下,大多数关于决策心理学的文献都集中于人们如何评估复杂的备选方案,这可能是因为这些是最有趣、最具挑战性的决策问题。

在本节中,我们将首先识别一些复杂指标,然后概述人们如何处理这些复杂指标的一些理论。最后我们将简要讨论大脑如何”优化”。

复杂指标

以下是第2章应用中一些复杂决策问题的示例:

这些每一个都可以呈现为”智能试错”问题的一个例子(参见第2章的智能试错小节),其中存在一组离散选择。使这些选择变得困难的原因是:a)它们很重要,b)我们对每种选择的表现存在相当大的不确定性。

我们可以将具有复杂备选方案的问题分为三类:

第一类已经引起了优化文献的相当关注,但它仍然是人们经常面对的一种非常普遍的情境,人们在其中未能使用最佳方法来处理不确定性。第二类是另一个常见主题,通常涉及向决策者提出不同的备选方案,然后要求其做出选择。第三类是心理学文献中的一个常见问题,因为存在这样的问题(如上面列出的那些),某人可能对自己想做出的选择有一种直觉感受,却无法阐明为什么这是最佳的。

关于指标形成的一些理论

评估备选方案的不同理论示例包括:

前景理论 - 前景理论的关键原则包括:

心理账户理论 - 这指的是人们通过在心中创建独立的”账户”来组织、分类和评估财务决策的方式,而不是将金钱视为完全可互换/可替代的。一些关键概念包括:

归因理论 - 归因理论解释了人们如何解读自己和他人行为的原因,尤其是在成就情境下,例如成功或失败。例如,消费者会为自己的购买决策分配理由,从而影响品牌认知和忠诚度。因果归因的三个维度包括:

这些归因会影响情绪和未来的动机。例如:

大脑如何学会优化

人们一直有很强的倾向,将智能归因于用于学习词语模式的神经网络。虽然识别模式确实是一种重要的智能形式,但它与做决策的过程明显不同,而人类完全有能力做决策。做决策需要能够最大化与实现某个目标相关的奖励,这个目标可能与进食、感到舒适、避免痛苦、赢得比赛或解决问题有关。

事实证明,大脑具有非常特定的功能来帮助优化一个与简单模式匹配毫无关系的目标。这是通过大脑中被称为奖励受体的部分完成的,这些受体是响应神经递质(如多巴胺)的特化蛋白质,帮助大脑体验愉悦、动机以及正向或负向强化。神经递质就像分子锁,当正确的化学钥匙与它们结合时就会被激活,进而触发引导行为的神经活动。

奖励受体的类型包括:

显然,对这些极其复杂机制的任何讨论都远远超出了本书的范围。我们要说明的是,大脑具有特定的机制来最大化奖励,这就是它能够选择最佳决策的方式。这一过程与大脑用于识别模式的强大机制是不同的。相比之下,大语言模型使用的神经网络是被训练来识别模式或文本的;这些网络使用单一目标函数,该函数捕捉了一个函数(神经网络)与训练数据集之间的相似性。

为他人设定绩效目标

指标的一个重要维度是为评估个人或团体的表现而设定目标。这本质上意味着一种多智能体环境,其中一个决策者有权为组织中的另一个单元设定绩效目标。在多智能体环境中,一个智能体的目标可能就是另一个(可能是更高层级的)智能体所做的决策。

在具有多个决策单元(通常以层级方式组织)的组织背景下,目标设定是一个特别丰富的领域。我们将在未来的卷中回到这个主题。

习题

复习题

  1. 列举五个性能指标的例子。
  2. 目标(objectives)、指标(targets)和限制(limits)分别是什么意思?为这三个类别中的每一个给出一个指标示例。你可以使用第2章中任何示例中的指标(它们不必都来自同一个示例)。
  3. 什么是风险事件?如果你是以下角色,请给出风险事件的例子:
    1. 某地区电网的运营商。
    2. 与患者合作管理其糖尿病的医生。
    3. 某供应链的首席财务官。
  4. 列举两种关于人们如何评估选择的理论。
  5. 列举大脑用来奖励特定行为的四种受体。
  6. 针对习题3中每个风险事件的例子,为该事件设计一个风险指标。

建模题

对于以下每个问题,针对指定应用,使用给定决策者提供的指标,设计一个指标金字塔。

  1. 你是一名供应链经理,负责为空调组件挑选供应商。供应商可能位于世界任何地方。
  2. 你需要为一家家具零售店补充各类家具的库存。
  3. 你需要规划新发电产能的投资(这些订单可能提前五年下达)。
  4. 你是一家酒店的收益经理。
  5. 你是一名为糖尿病患者选择治疗方案的医生。
  6. 你是州政府官员,需要在全州各县之间分配纳洛酮药盒。
  7. 你是一家制药公司的负责人,需要选择哪些药物进入二期临床试验。
  8. 你是总统竞选的竞选经理。
  9. 你是一家整车运输公司的运营副总裁,需要管理调度员(负责将司机分配给货运任务)和货运经理(负责决定运送哪些货物)。
  10. 你是共同基金经理,需要确定应持有多少现金。