贝尔曼方程最重要的启发,不是教人“精确计算人生”,而是提供一种看待连续决策的方式:今天的选择,既产生眼前结果,也把你带到一个新的状态;真正值得优化的,是“当下收益 + 未来可能性”。
贝尔曼方程常写成:
其中:
- s:当前状态,例如能力、健康、收入、关系、时间;
- a:此刻可以采取的行动;
- r(s,a):行动带来的即时收益或成本;
- s′:行动之后进入的新状态;
- V(s′):新状态所包含的未来价值;
- γ:你对未来价值的重视程度。
把它翻译成生活语言就是:
一个决定好不好,不能只看它现在让我得到什么,还要看它会把我变成谁、带到哪里,以及以后还能做什么。
一、不要只选择“收益最高的行动”,要选择“更好的下一个状态”
生活中常见的错误,是只比较即时结果。
例如两份工作:
- 工作甲:工资更高,但高度消耗时间,技能增长有限;
- 工作乙:工资稍低,但能接触优秀的人、积累可迁移能力,并保留更多选择。
如果只看即时奖励 r,甲可能更好;如果把未来状态的价值 V(s′) 算进去,乙可能更优。
因此,评价一个选择时,不妨多问一句:
这个决定完成后,我会进入一个怎样的状态?
好的状态通常具有一些共同特征:身体尚好、认知更清晰、能力更强、关系更稳、现金流可持续,而且保留着一定的行动自由。
这也解释了为什么学习、锻炼、储蓄、建立信誉等事情短期看起来“回报不高”,长期却很有价值:它们主要不是提供一次性收益,而是在提高未来所有决策的质量。
二、人生不是一次总决策,而是一系列滚动决策
很多焦虑来自这样一种误解:
我现在必须做出一个决定,确定未来十年的人生。
贝尔曼思想则把大问题拆成连续的小问题。你不需要一次看清全部路径,只需要努力做出一个能把你带到较好状态的下一步,然后在新状态中重新计算。
比如职业转型,不一定要问:
我该不该永远离开这个行业?
可以改成:
接下来三个月,我能否用较低成本验证自己是否适合另一个方向?
于是行动可能变成:
- 旁听课程;
- 做一个小项目;
- 与行业从业者交流;
- 尝试兼职或短期合作;
- 检查真实市场需求。
这相当于把一个巨大、不可逆的决定,改造成一组可观察、可调整的状态转移。
人生中的很多“终身选择”,其实都可以改写为“下一阶段选择”。
三、好的决定往往会增加未来的选择权
在不确定环境中,未来价值很大一部分来自选择权。
假设两个行动的短期收益相近:
- 一个行动会让你越来越依赖单一客户、单一技能或单一关系;
- 另一个行动会让你认识更多人、积累通用能力、提高储蓄并获得更多信息。
后者的价值不一定立即体现在收入上,但它增加了未来可选行动的数量。
因此,在高度不确定的时期,值得优先考虑那些:
- 可逆;
- 成本有限;
- 能带来信息;
- 能积累通用资源;
- 成功后有较大收益;
- 失败后仍可承受。
例如先做小规模试验,再全面投入;先建立应急储蓄,再考虑高风险转换;先学习可迁移技能,再押注某个具体平台。
可以把它概括为:
不确定时,不必急着找到唯一正确答案,而要尽量进入“以后仍然有好牌可打”的状态。
四、重视长期,不等于忽视当下
贝尔曼方程中有一个折扣因子 γ。它提醒我们,未来很重要,但不能被无限夸大。
如果一个人把 γ 设得太低,就容易只追求即时满足:
- 熬夜换娱乐;
- 透支换消费;
- 用关系中的短期胜负破坏长期信任;
- 为眼前业绩牺牲能力和健康。
但如果把 γ 想象得过高,也会出现另一种问题:为了遥远目标无限推迟生活。
- 永远等到“成功以后”才休息;
- 永远把快乐视为不生产的浪费;
- 为一个未经验证的未来,长期忍受不可持续的状态。
健康的策略不是一味牺牲当下,而是让当下与未来形成可持续的配合:
今天的生活不能把明天毁掉,明天的理想也不能把今天完全取消。
五、真正重要的是“重复发生的决策”
一次选择的影响有限,反复选择的影响巨大。
每天晚睡一次,代价可能很小;如果“疲惫—拖延—熬夜—更疲惫”成为稳定循环,问题就不再是一次奖励,而是进入了一个低价值状态。
反过来,许多好习惯也不是因为某一次收益巨大,而是它们不断把人推向更好的状态:
所以,生活管理不能只依赖意志力,还要设计“状态转移”:
- 把运动装备放在容易看见的位置;
- 减少高诱惑应用的入口;
- 设置自动储蓄;
- 固定重要任务的时间;
- 让好行为之后自然接上下一个好行为。
一个理想系统并不是要求你每天都英明,而是让普通状态下的你也比较容易做出好选择。
六、决策质量取决于你如何定义“奖励”
数学模型中,目标函数一旦确定,系统就会努力优化它。生活中最大的风险往往不是执行不力,而是奖励定义错了。
如果把收入设为唯一奖励,人可能牺牲健康和关系;如果把他人认可设为唯一奖励,人可能失去自主判断;如果把效率设为唯一奖励,休息、友谊和好奇心都会被误判为浪费。
现实中的“奖励”至少包括:
- 健康;
- 自主性;
- 有意义的关系;
- 能力与成长;
- 经济安全;
- 尊严与价值一致性;
- 体验与快乐。
这些维度无法完全用一个数字折算。因此,贝尔曼方程带来的更深层提醒是:
在努力优化人生之前,先检查自己究竟在优化什么。
很多“成功但不幸福”的情况,本质上不是优化失败,而是对一个狭窄指标优化得过于成功。
七、信息本身也是一种收益
有些行动的直接结果很小,但能显著减少不确定性。
例如你不知道自己是否适合创业。与其反复思考,不如做一次低成本实验:
- 试着销售一个最小产品;
- 访谈十位潜在客户;
- 用周末完成一次交付;
- 记录自己对销售、管理和不确定性的真实反应。
即使实验没有赚钱,它也可能带来高价值信息。
所以评价行动时,除了问“它能否成功”,还要问:
无论成功或失败,我能学到什么?
能够快速产生可靠反馈的行动,通常优于长期停留在抽象推演中的行动。思考能够排除明显错误,但很多人生问题必须通过进入新状态才能得到答案。
八、先处理会持续恶化的状态变量
贝尔曼框架还提醒我们,不同状态变量会相互影响。
比如健康下降,不只产生身体成本,还会影响情绪、收入、关系和判断;严重债务也不仅是财务问题,它会压缩人的选择空间,使其更容易接受短视方案。
因此,某些变量具有基础性:
- 睡眠与健康;
- 基本现金流;
- 安全;
- 可信赖的关系;
- 基础能力;
- 情绪稳定性。
当这些变量接近危险边界时,最优策略通常不是追求更高上限,而是先避免系统崩溃。
换句话说:
人生决策不仅要追求期望收益,还要避免进入难以恢复的坏状态。
这也是为什么风险管理常比“押中最大机会”更重要。只有没有出局,未来价值才仍然存在。
九、不要把暂时的状态误认为固定的自我
贝尔曼方程中的 s 是“当前状态”,而不是永恒身份。
“我现在不擅长表达”与“我就是一个不会表达的人”,是两种完全不同的认识。前者把问题视为状态,意味着可以通过行动转移;后者把它变成身份,仿佛没有下一步。
更有建设性的表达是:
- 我目前缺少这项能力;
- 我现在的信息不足;
- 我处在疲惫状态;
- 我还没有形成稳定习惯;
- 我暂时没有找到合适的方法。
这种语言不是自我安慰,而是在保留行动空间。
十、生活并不完全满足贝尔曼方程
贝尔曼思想很有启发,但不能机械套用。现实人生与标准动态规划有几个重要差别:
第一,人生的奖励并不清晰,而且会变化。二十岁看重的东西,四十岁未必仍然相同。
第二,未来状态的概率很难准确估计。人际关系、时代变化和偶然事件都具有高度不确定性。
第三,人的偏好会被行动本身改变。学习音乐不只是满足原有兴趣,也可能创造新的兴趣;承担责任也可能改变一个人的人格和价值观。
第四,有些事情的价值来自投入本身,而不是最终结果。友情、创作、照顾家人,未必适合被理解为纯粹的收益最大化。
第五,人生不是单人游戏。你的选择会影响他人的状态,他人的选择也会影响你。承诺、信任和伦理不能简单压缩为个人回报。
所以,贝尔曼方程适合作为思维工具,而不是人生宗教。
一个可实际使用的决策模板
- 我当前真实的状态是什么?区分事实、情绪和自我评价。
- 我现在实际有哪些行动?不只比较“做”与“不做”,还要寻找小规模试验和中间方案。
- 每个行动的即时收益和成本是什么?包括金钱、时间、情绪、健康和关系。
- 它会把我带到什么状态?我会获得什么能力、信息、资源和约束?
- 新状态保留了多少选择权?是否容易退出、调整或转向?
- 最坏状态是否可承受?不只看平均收益,也要看是否存在不可逆损失。
- 我准备在什么时候重新评估?不把今天的决定变成永远不允许修改的承诺。
最后,可以把贝尔曼方程对生活的启发浓缩为一句话:
不必每次都决定整个人生;努力做出一个既照顾当下、又能把自己送往更好下一状态的选择,然后继续观察、学习和更新。
成熟的决策,不是永远猜中遥远的未来,而是在无法完全看清未来时,仍然能够一步步进入更有能力、更有余地、也更愿意生活下去的状态。
跳到正文