假设6的作用

假设6的作用 还原后是假设 6*our next assumption is a fundamental one所指的那一条及其后的可验证充分条件6*There exists a sequencesuch thatis isotone and-Lipschitzian (on) for eachand.We sayis-outer boundedonifand if,,andimply. It is straightforward to show that if eachis-outer bounded, then 6* will hold. It is also straightforward to show that if 2*–4* and 6* hold, thenis isotone and-Lipschitzian onfor each.6* 说的是什么它把 isotone 与 Lipschitz 两条性质同时加在所有单策略算子上且 Lipschitz 系数只依赖阶段、不依赖——这个一致性是关键。在标准 MDP 里就是折现因子允许它随 t 变是为覆盖非平稳过程。注意他没要求单阶段可以扩张只要后面 9.3* 中的乘积最终衰减到零即可。为什么要引入 outer bounded因为 6* 的两条性质在应用中不好直接验证isotone 要比较两个函数Lipschitz 要控制上确界范数且要对所有一致。而-outer bounded 把两者合并成一条单一的、只涉及常数平移的不等式具体来说验证 isotone 需要逐一检查任意两个满足的续值函数确认算子作用后仍保持序关系这本质上是在函数空间上做逐点比较工作量随状态空间规模迅速膨胀验证 Lipschitz 则要计算并控制上确界范数意义下的放大倍数还要保证这个放大倍数对每一个策略都一致成立否则后续取上确界时系数可能发散。两条性质分开验证既繁琐又容易遗漏边界情形。而-outer bounded 把这两条性质压缩成一条只涉及常数平移的检验只要把续值函数整体抬高一个非负常数本阶段算子作用后的值至多被抬高。这样一来验证工作就从比较两个任意函数简化为考察一个常数平移的响应大大降低了操作难度也天然保证了对所有的一致性——因为不等式右端的与无关。它同时蕴含两者取立刻得到 isotone取有限时由与两边各用一次得与合起来就是。这正是 Blackwell 充分条件的形式单调性 折现性只不过 Porteus 把它写成一个条件而非两个。实用价值在于验证 outer bounded 通常只需检查把续值函数整体抬高常数本阶段值至多抬高。对形如的标准折现模型这是显然的等号成立。对风险敏感模型他那个常绝对风险厌恶的应用确定性等价算子对常数平移也是平移不变的与指数效用的性质所以同样成立——这才是他绕这个弯的真正原因outer bounded 覆盖了非线性的确定性等价算子而直接假设期望 折现则覆盖不了。第二句话是整套框架的枢纽若 2*–4* 和 6* 成立则在上 isotone 且-Lipschitzian。这是把性质从单个策略的算子提升到最优算子。回到你前面问过的那个点上确界一般不保结构凹性、有限性都可能丢但 isotone 与 Lipschitz 是少数几条能穿过上确界的性质。isotone对每个成立右端与无关取 sup 得。Lipschitz由取 sup 得对称即可。系数对一致是这一步能走通的前提这也是 6* 中存在一个序列而非对每个存在的原因。而 4*保结构之所以必须单列为假设、不能由 6* 推出也正在于此结构性质-凸、凹、单调门限恰恰不穿过上确界必须逐个模型另证。在框架中的位置到这里三类假设的分工完整了2*、3*值函数空间的良定义与封闭性4*、5*/5**结构性质的传递值与实现策略6*算子的度量性质为无限期的极限论证9.1*–9.3*、引理 1–2提供压缩性——通常一行带过。前两类决定最优策略长什么样第三类决定有限期结论能否传到无限期。你在自己的模型里若只做有限期6* 这一类可以完全略去一旦要论证无限期或平稳最优就必须显式给出折现因子的一致界否则值迭代的收敛性和 Bellman 方程解的唯一性都无从谈起。We sayis-optimal for stagestoif. Hereafter drop when.THEOREM 1.If, 1*–6* hold, and, then1°for each;2° (Bellmans finite horizon optimality equation)for each;3°is the unique sequence of admissible value functions which satisfies 2° and;4° For each, there exists a structured strategywhich is, simultaneously for all,-optimal for stagesto;5° (Bellmans finite horizon optimality conditions)is simultaneously for alloptimal for stagestoif and only ifattainsfor each;6° If 5** holds (in place of 5*), then there exists a structured strategy which is simultaneously for alloptimal for stagesto.simultaneously for all 是这条定理里最容易被略过、也最有分量的措辞它要求同一个策略组合对每一个尾子问题都-最优而不只是从阶段 1 看最优。这比通常说的最优强。差别在于一个只从阶段 1 最优的策略可能在某个概率为零、或从初始状态根本到不了的状态上规定了愚蠢的决策——从阶段 1 看无损失但把该状态当作起点时就不最优了。Porteus 要的是时间一致性意义上的最优这也是他反复强调的interstage consistency。这个加强在这里是免费的因为取的是全状态空间上的一致上确界倒推时每一阶段的比较本来就覆盖所有状态。各条的来源与前面那些假设一一对应结论主要依赖1° 最优值结构化4* 终端条件倒推归纳2° Bellman 方程3* 为直积逐点化3° 唯一性2*可行值函数次有限有限期倒推平凡4°-最优结构化策略5* 6*误差传播控制5° 充要条件2° 有限性6° 严格最优5**6* 在这里干的活有限期只有步直觉上不需要压缩性。但 4° 要的是结构化策略且误差一致有界这就必须控制误差沿倒推的累积。做法是由 5*在第阶段选使。但真实用的是而非后续阶段已经有误差了。此时靠 6*于是误差递推为总误差被控制。只要把取得足够小例如按的幂次配比就能让所有同时满足。isotone 用于保证不等式方向在算子作用下不翻转。所以 6* 在有限期不是为了收敛而是为了误差不被逐级放大。5° 的当且仅当值得注意充分性是标准的验证论证。必要性——最优策略必须逐阶段达到——依赖有限性由 2*结构化值函数不许取加上 1° 保证有限才能做若某阶段有严格间隙则总值必严格更差的减法。若允许与的比较失效必要性会崩。这就是他为什么在 2* 中对可行值函数只要求次有限、却对结构化值函数要求完全有限。也正因如此无限期时这个当且仅当一般不成立Bellman 条件仍充分但必要性需要额外条件正是后面定理 2、3 中那些 regular 值函数、约化状态空间和 Lipschitz 型假设 9.1*–9.3* 要处理的。有限期的干净结论不能直接照搬到无限期这是这篇文章后半部分存在的全部理由。对你的模型的两点实用提示一是这个前提。归纳的基是终端值函数本身必须结构化。实际建模时终端条件常被随手设成 0 或残值线性函数通常没问题但若你为了逼近无限期而设一个复杂的终端函数比如某个拟合出来的连续函数必须先验证它落在你的结构类里否则第一步归纳就断了。这个疏漏在数值实验的收敛性讨论里很常见。二是 6° 与 4° 的区别在你写作时应当明确如果你的决策集是有限的比如升级/不升级、离散容量档位5** 几乎自动成立直接写 6° 的严格最优版本如果决策含连续无界变量就要么补紧性论证要么诚实地退到 4° 的-最优表述。