从世界模型到心智世界模型:下一代AI的演进与工程实践 📅 发布时间:2026/8/31 22:20:02 👁 浏览次数: 最近如果持续关注 AI 的前沿进展应该会发现“世界模型”这个词出现的频率越来越高。从视频生成模型被重新解读为“世界模拟器”到具身智能、自动驾驶、机器人领域都在尝试引入世界模型很多人把它看作是通向通用人工智能的关键拼图之一。最近牛津大学和新加坡国立大学NUS的研究团队又把这个方向往前推了一步提出“心智世界模型”作为下一代世界模型的研究方向。这篇文章不打算只做新闻转述而是想把世界模型、大模型、心智世界模型这三者之间的关系理清楚并结合实现思路、训练数据设计、落地场景和常见误区做一次系统拆解。无论你是做算法研究、后端开发还是正在跟进 AI 前沿趋势这篇文章都能帮你建立一套相对完整的认知框架。1. 为什么“世界模型”突然成了 AI 的热点方向1.1 什么是世界模型先看一个形象的类比世界模型World Model并不是一个全新的概念。早在认知科学和心理学中研究者就注意到人类大脑并不是简单地记录环境信息而是会建立一个关于外部世界的内部模型。比如你不需要真的把杯子推下桌子就能在脑海里预演杯子落地摔碎的画面你开车经过路口时会根据前车的速度、行人的位置提前预测接下来几秒可能发生的情况。这种“在脑子里做模拟”的能力就是人类世界模型的一种体现。在 AI 领域世界模型被定义为一种能够学习环境内部状态表征并预测状态转移规律的模型。通俗地说它不只是“看见”当前画面而是能回答“接下来会发生什么”以及“如果我执行某个动作环境会变成什么样”。这种能力对规划、决策、强化学习都至关重要因为有了可预测的模型智能体就不需要每次都拿真实环境去试错而可以在自己的“想象空间”里做大量推演。早期比较有代表性的工作是 David Ha 与 Jürgen Schmidhuber 在 2018 年前后发表的“World Models”相关研究它通过一个压缩感知的隐空间模型让智能体在“梦境”中训练策略在小车平衡等任务上取得了很好的效果。这类工作确立了世界模型的基本范式感知编码器 动态预测模型 策略控制模块。1.2 从视频生成到“世界模拟器”世界模型之所以在最近两年突然火热一个很重要的触发点是视频生成类模型的爆发。2024 年前后随着视频生成技术的能力大幅提升不少人开始把这些能够生成连续、合理未来画面的模型称作“世界模拟器”。因为从现象上看一个能够生成一段没有真实视频作为底稿的未来画面的模型似乎内部确实学到了某种关于物理规律、物体运动和场景布局的知识。这种说法让“世界模型”从学术圈的小众概念变成了产业界和大众讨论的热门词。但需要注意的是视频生成能力并不等于完整的世界模型。世界模型的核心是“状态表征”和“动态预测”它关心的是环境内部的因果结构和状态转移而不仅仅是像素看起来像不像。能生成一段漂亮的视频只能说明模型学到了某种层面的统计规律它是否真正拥有可泛化的物理因果模型是另一个问题。这也引出了接下来要讲的一个关键区分世界模型与大模型到底是什么关系两者差在哪里。2. 世界模型与大模型的区别两种不同的智能方向2.1 学习目标和输入输出的不同大模型尤其是当前广泛讨论的大语言模型核心学习目标是“根据前文预测下一个 token”。无论是 GPT 系列还是其他主流语言模型训练任务本质上都是在大规模文本上做自回归式预测。它的输入是离散的文本符号输出也是离散的文本符号。在这个过程中模型确实学到了大量关于语言结构、事实知识和推理模式的信息但它学到的“世界”更多是通过文字间接描述的世界而不是直接感知和交互的世界。世界模型的学习目标则完全不同。它要预测的是环境状态的转移通常涉及连续的状态向量、位置坐标、速度、场景布局甚至是物理量。一个典型的训练任务是给定当前观测和动作预测下一时刻的观测或者给定一段历史轨迹在隐空间中推断未来的状态序列。这意味着世界模型的输入输出往往是多模态的包括图像、点云、传感器数据、动作序列等而不仅仅是文字。简单总结大模型回答“这句话接什么最合理”世界模型回答“这个环境接下来会变成什么样”。2.2 能力边界的差异大模型具备很强的语义理解和知识推理能力。比如你问它“一辆车在冰面上急刹车会怎么样”它能给出相当合理的物理描述。但这并不代表它内部真的有一个可以模拟刹车过程的动态模型。它只是从海量文本中学到了这种问答模式。如果换成一个完全新颖、没有文本先例的物理场景大模型的预测就可能不可靠。世界模型的能力重点在于动态推演。它能接收环境状态预测下一步变化甚至支持反事实推演如果当时换一个动作结果会不会不同。这种能力是决策和规划的基础。不过传统世界模型在语义理解、常识推理和开放知识方面往往比较弱这也是为什么近年来很多人开始尝试把大模型的语义能力与世界模型的动态预测能力结合起来。需要澄清的是“大模型是不是已经在训练中学会了世界模型”是目前学术界很有争议的话题。一些研究通过大模型回答物理常识问题的表现认为模型内部隐式具备了某种世界知识另一些研究则指出语言模型的回答更多来自数据统计一旦进入需要精确连续状态预测的任务表现并不理想。比较稳妥的结论是大模型具备世界知识的“影子”但距离真正可计算、可干预、可验证的世界模型还有明显距离。2.3 两者不是替代关系而是互补关系未来的 AI 系统大概率不是二选一而是让大模型负责高层次理解、规划、语言交互让世界模型负责底层状态推演、动作结果预测和想象空间搜索。比如一个家庭机器人接收“帮我把桌上的杯子拿过来”这个指令需要大模型理解语义、拆解任务当它真正运动时需要世界模型判断“伸手会不会碰到旁边的花瓶”“杯子被拿起后重心会不会偏移”。前者是知识后者是动态模拟能力。理解了这层区别之后再回头看待“心智世界模型”就会发现它的提出逻辑非常自然既然我们要让机器人与真实世界有效交互而真实世界里不仅有物理物体还有大量具有意图、信念、情绪的人类和其他智能体那么世界模型就不能只建模物理状态还必须建模“心智”。3. 心智世界模型牛津、NUS 提出的下一代方向3.1 传统世界模型少了什么设想一个场景自动驾驶汽车行驶到无信号灯路口对面有一个行人正在犹豫是否过马路。传统世界模型可以精确预测车辆和行人的物理位置人的 bounding box 在哪里速度是多少未来 2 秒可能走到哪里。但如果要做出真正安全的决策仅仅知道位置是不够的。我们需要判断行人的意图他到底是想过马路还是在等人他有没有看到我们的车他认为我们会不会让行这类问题依赖的不是物理预测而是对他人心智状态的推断。人类司机之所以能在复杂路况下安全驾驶很大程度上不是因为物理计算能力有多强而是因为我们有一套朴素的“心理理论”我们天然会推断别人的意图、信念和预期。传统世界模型恰恰缺少这一层。这也正是“心智世界模型”的切入点。它的核心主张是下一代世界模型不能只把环境建模成物体的集合还应该把“智能体的内心状态”当作需要显式表示和预测的对象包括信念、欲望、意图、情绪、注意力以及“他认为我认为他认为……”这种递归推理。3.2 心智世界模型的核心把“心智状态”变成一等公民按照牛津大学与 NUS 团队提出的研究方向来理解心智世界模型是在传统世界模型之上加入了心智状态层。传统的世界模型状态可以用 S_t 表示它描述的是客观环境心智世界模型则把状态扩展为 S_t 加上一组心智状态 M_t其中 M_t 描述环境中各智能体的信念、意图等内部状态。为什么叫“一等公民”因为心智状态不应该只是从文本中附带推理出来的辅助信息而应该是模型系统中独立存在、可被预测、可被干预、可用于规划的正式状态变量。模型不仅要知道“行人站在路边”还要显式维护一个“行人的信念”表示并预测它在车辆减速动作之后会发生什么变化。从心理学角度看这个方向与“心理理论”和“心智模型”概念一脉相承。最经典的例子是儿童心理理论测试中的“Sally-Anne 测试”一个人物知道玩具在 A 处另一个人物不知道玩具已经被转移到 B 处被试需要判断第二个人会去哪里找。这个任务考验的正是“他人信念可能与客观事实不一致”的建模能力。心智世界模型要解决的就是让 AI 系统拥有类似的推断能力它知道我知道我知道它不知道。当然目前公开资料中更多是方向层面和概念层面的阐述具体论文的完整实验细节、模型架构和开源进展还需要结合团队后续发布内容来看。对开发者而言更重要的是理解这个方向的技术意图让世界模型从“物理模拟器”升级为“同时包含物理与社会心理的社会模拟器”。3.3 它和大模型 Agent 的关系当前以大模型为核心的 Agent 产品已经有了一些“揣测用户意图”的能力比如根据用户历史偏好推荐内容或者在对话中推测用户的心情。但这种能力通常来自大模型在文本语料中学到的模式并不是在一个连贯的世界模型框架下实现的。心智世界模型希望把这种能力系统化让智能体在一个统一的状态空间中同时维护客观世界状态、自身心智状态和他者心智状态并在行动规划时综合考虑这些状态的变化。如果沿着这个方向落地未来的 Agent 不再只是“根据指令完成任务”而是能够理解任务背后的人类意图预测自己的行为会如何影响对方的信念和情绪进而做出更符合社会规范的决策。这也是为什么很多关注者认为心智世界模型不仅是学术上的新名词更可能是下一代人机交互系统的重要基础设施。4. 心智世界模型的技术拆解与最小实现思路4.1 心智状态如何表示要让心智世界模型可训练首先得定义“心智状态”的表示方式。目前比较可行的思路有两种。第一种是符号化表示。借鉴经典人工智能中的 BDI 框架Belief-Desire-Intention信念-欲望-意图把智能体的心智状态显式建模为结构化字段。比如{ agent_id: pedestrian_01, mental_state: { belief: { car_visible: true, car_will_yield: false }, desire: { goal: cross_the_road, priority: 0.9 }, intention: { action: wait_at_sidewalk, confidence: 0.8 }, emotion: { stress: 0.4, trust_in_driver: 0.3 } }, physical_state: { position: [12.3, 45.6], speed: 0.1 } }这种表示的优点是可解释性强方便标注和评估缺点是需要人工定义大量字段灵活性有限难以覆盖复杂真实场景。它适合作为研究初期和合成环境的数据格式。第二种是向量化隐式表示。也就是不显式定义心智字段而是让神经网络通过训练自动学出一个“心智向量”作为物理状态向量之外的伴随状态。这种方式更接近深度学习的端到端思路灵活度高但可解释性较差训练数据获取也更难。比较务实的做法是混合式内部用隐向量建模外部用符号化信息做监督信号和评估辅助。4.2 一个整体架构参考为了把概念落到可执行层面下面给出一个简化架构图它把物理状态编码和心智状态编码并行处理再做联合预测观测序列 ──► 物理状态编码器 ──► 物理状态 h_phy 观测序列 动作序列 ──► 心智状态编码器 ──► 心智状态 h_mental h_phy h_mental ──► 联合动态预测器 ──► 下一时刻物理状态 下一时刻心智状态 h_mental ──► 意图/信念解码器 ──► 可解释的心智推断结果物理状态编码器可以用常见的序列模型比如 GRU、LSTM 或 Transformer负责把连续的观测压缩成环境状态。心智状态编码器除了接收观测还需要接收动作信息因为在社会交互中一个人的意图往往体现在“他做了什么”上。联合动态预测器则负责把两类状态融合预测未来的完整状态包括物体位置和智能体心智变化。4.3 训练数据长什么样心智世界模型最大的瓶颈之一就是数据我们需要同时具备物理状态标注和心智状态标注的数据。真实视频数据中物理状态相对好标注但心智状态比如“这个行人认为汽车会不会让行”几乎无法从画面中可靠获取。因此当前阶段比较可行的办法是使用合成环境生成训练数据在模拟器中让智能体带有明确的目标、信念和意图然后自动导出物理状态与心智状态标签。一个带心智标注的训练样本可以设计成下面这样的结构{ episode_id: epi_crossroad_0001, scene: unsignalized_crosswalk, input: { observations: [frame_0120.jpg, frame_0121.jpg], actions: [decelerate, stop] }, physical_target: { ego_pose: [120.3, 88.1], pedestrian_position: [95.2, 42.7], distance_to_pedestrian: 18.5 }, mental_target: { pedestrian_belief: car_will_stop, pedestrian_intention: start_crossing, ego_plan: wait_at_stopline } }可以看到训练目标的维度明显比传统世界模型多了一层。模型不仅要学会预测“车距离行人多少米”还要学会预测“行人接下来会不会过马路”而后者由前者的动作隐含决定。这种数据设计也决定了心智世界模型的训练不能只使用普通视频数据集必须依赖可控、可标注的仿真环境。4.4 模型骨架与训练流程示例下面给出一个简化版模型骨架只用于理解模块之间的连接关系不代表任何已发表论文的官方实现。实际项目需要根据自己的数据格式和框架调整。# 文件路径mental_world_model/model.py # 说明这是用于理解“心智世界模型”结构的示意代码不能直接用于仓库复现。 import torch import torch.nn as nn class MentalWorldModel(nn.Module): 简化版心智世界模型联合建模物理状态与心智状态。 def __init__(self, state_dim: int, mental_dim: int, action_dim: int): super().__init__() # 物理状态编码器从观测序列中提取环境状态 self.physical_encoder nn.GRU( input_sizestate_dim, hidden_sizestate_dim, batch_firstTrue ) # 心智状态编码器从观测与动作序列中推断智能体心智状态 self.mental_encoder nn.GRU( input_sizestate_dim action_dim, hidden_sizemental_dim, batch_firstTrue ) # 联合预测头输出下一时刻的物理状态与心智状态拼接向量 self.predictor nn.Sequential( nn.Linear(state_dim mental_dim, 256), nn.ReLU(), nn.Linear(256, state_dim mental_dim), ) def forward(self, obs_seq: torch.Tensor, action_seq: torch.Tensor) - torch.Tensor: # obs_seq: [batch, seq_len, state_dim] # action_seq: [batch, seq_len, action_dim] _, physical_hidden self.physical_encoder(obs_seq) mental_input torch.cat([obs_seq, action_seq], dim-1) _, mental_hidden self.mental_encoder(mental_input) # 取最后一个时刻的隐状态 physical_state physical_hidden[-1] mental_state mental_hidden[-1] # 联合预测下一时刻状态 combined torch.cat([physical_state, mental_state], dim-1) next_state self.predictor(combined) return next_state对应的训练主循环片段可以这样设计# 文件路径mental_world_model/pretrain.py # 说明训练流程示意片段需要补齐数据集与损失函数定义。 import torch from torch.utils.data import DataLoader from mental_world_model.model import MentalWorldModel model MentalWorldModel(state_dim512, mental_dim256, action_dim32) optimizer torch.optim.AdamW(model.parameters(), lr1e-4) # 这里假设 dataset 已经能返回 # obs_seq、action_seq、physical_target、mental_target dataloader DataLoader(dataset, batch_size16, shuffleTrue) for epoch in range(100): for batch in dataloader: obs_seq, action_seq, physical_target, mental_target batch pred model(obs_seq, action_seq) # 物理损失预测的物理状态与真实物理状态的误差 loss_physical physical_loss(pred, physical_target) # 心智损失预测的心智状态与标注心智状态的误差 loss_mental mental_loss(pred, mental_target) loss loss_physical loss_mental optimizer.zero_grad() loss.backward() optimizer.step()这里最关键的设计是损失函数要同时包含物理预测和心智预测两部分的监督信号。如果只保留物理损失模型很容易退化成传统世界模型如果只保留心智损失又会丢失对物理动态的把握。工程上需要找到两者之间的平衡权重最好根据训练阶段动态调整。训练配置可以单独放在 YAML 文件中方便实验管理# 文件路径config/mental_world_model.yaml # 说明训练配置示例具体数值需根据数据规模和算力调整。 model: state_dim: 512 mental_dim: 256 action_dim: 32 use_mental_encoder: true data: dataset: synthetic_social_env modalities: [rgb, action_log, mental_annotation] batch_size: 16 cache_dir: ./data_cache training: epochs: 100 learning_rate: 0.0001 loss: physical_weight: 1.0 mental_weight: 0.5 checkpoint_dir: ./checkpoints evaluation: metrics: [next_state_acc, belief_alignment, intent_recall]启动训练的命令大致如下cd mental_world_model python -m venv venv source venv/bin/activate pip install torch python pretrain.py --config config/mental_world_model.yaml需要再次强调这只是为了帮助读者理解心智世界模型的代码组织方式离真正可跑的完整项目还有很大距离。真正的难点不在模型结构而在数据生成、心智标注、评测指标设计这些“看不见”的地方。5. 心智世界模型的典型落地场景5.1 具身智能与机器人协作家庭机器人如果要在真实环境中长期服务就必须理解人的意图和情绪。比如当机器人看到主人把一个空杯子推向桌边它需要判断主人是想让机器人接走杯子还是只是随手一放。这两种情况对应完全不同的行动方案。传统感知模型很难区分而带有心智世界模型的机器人可以维护“主人当前意图”的隐式状态并根据后续行为动态更新。人机协作中的安全性也会因此提高机器人能预测人类是否受到惊吓、是否会突然伸手从而提前调整动作幅度。5.2 自动驾驶与社会力交互自动驾驶是心智世界模型最有说服力的落地场景之一。当前很多自动驾驶系统已经能做行人和车辆轨迹预测但对“社会交互”的建模还很薄弱。一个带心智建模的系统不仅能预测行人下一帧的位置还能推断“行人是否注意到本车”“行人认为本车是否会让行”并进一步预测这个信念如何影响行人接下来的动作。这种能力能显著改善无信号灯路口、人车混行等长尾场景的安全表现。5.3 多智能体与游戏 AI在游戏 AI 中心智世界模型可以用于生成更逼真的 NPC 行为。传统 NPC 往往基于规则或简单行为树缺乏对玩家意图的理解。如果 NPC 能维护一个关于玩家目标、情绪的模型并根据玩家的行为更新它那么 NPC 的互动就会更自然。比如在合作游戏中NPC 能判断玩家是否陷入困境并主动调整策略在竞技游戏中NPC 能推测玩家的战术意图做出更有针对性的应对。这一方向已经在一些研究项目和前沿游戏产品中开始探索。5.4 大模型 Agent 的产品化对话 Agent 如果想要摆脱“机械感”就必须学会“读懂言外之意”。心智世界模型可以给 Agent 提供一个更结构化的用户模型用户当前的目标是什么、用户对产品的了解程度如何、用户是否对刚才的回答感到困惑。当 Agent 能持续维护并更新这类心智状态时它的回复就不再是孤立地逐句生成而是围绕一个长期稳定的用户模型来展开。这会直接改善智能客服、教育助手、办公助理等产品的体验。6. 常见问题与误区排查6.1 四个容易踩的认知误区关于心智世界模型目前讨论中经常出现下面几种理解偏差整理成表格方便对照常见误区更准确的理解世界模型就是视频生成模型视频生成只是表现手段世界模型核心是内部状态表征与动态预测大模型已经具备世界模型能力大模型更多掌握世界知识的语言描述缺少可干预、可验证的连续状态模拟心智世界模型就是给 AI 添加情感核心是建模和预测他人的信念、意图属于社会智能而不是让 AI 产生主观感受心智世界模型很快就能落地开源目前仍处于早期研究阶段数据标注和评测体系是最大瓶颈这些误区有一个共同来源把“表面上看起来像”当成了“本质上就是”。判断一个系统是不是世界模型不能只看它生成的视频有多流畅判断一个模型是否具备心智建模能力也不能只看它能否说出“我觉得用户不开心”这样一句话。关键要看系统内部是否真的把物理状态、心智状态作为可预测、可干预的计算对象。6.2 起步阶段的高频问题排查如果你准备动手实践心智世界模型途中大概率会遇到下面几类问题问题现象可能原因解决思路找不到官方开源代码研究方向刚提出工具链还不完整先复现经典世界模型再向心智维度扩展没有合适的数据集真实数据缺乏可靠心智状态标注使用合成环境生成带目标和信念的智能体数据模型只拟合了物理状态心智预测效果差损失权重失衡或心智监督信号过弱提高心智损失权重增加心智状态解码器辅助监督模型看起来聪明一换场景就崩塌过拟合了单一环境的数据分布增加环境多样性引入反事实训练样本7. 工程实践建议与学习路线7.1 如果现在要动手建议这样做对于有工程基础、想尽快上手的研究者我建议不要一上来就复现完整的心智世界模型而是先用一个足够简单的环境验证核心思路。一个很适合的起步实验是“带隐藏目标的网格世界”在 GridWorld 中放置两个智能体其中一个有隐藏的目标位置但它的行为会透露出关于目标的线索。训练一个模型同时预测网格中物体的位置变化以及“隐藏目标在哪”这个心智状态。这个实验虽然简单但已经包含了心智世界模型的所有关键要素物理状态智能体坐标、心智状态隐藏目标、基于行为的信念推断以及联合动态预测。你可以从这个小项目开始逐步替换成更复杂的仿真环境比如多智能体交通模拟器或带有社交场景的机器人仿真环境。工程上还要特别注意数据记录规范。心智状态标注非常昂贵建议在仿真环境中提前把目标的生成过程、行为策略、可观察线索都记录下来这样训练数据才有完整的因果链条。如果数据里缺少“目标生成”的真实信息模型就很难学到可靠的心智状态表征。另外心智世界模型涉及对用户信念、情绪、意图的推断如果未来应用到真实用户场景必须充分考虑隐私和知情同意问题。不能在没有明确授权的情况下对真实用户做细粒度的心理画像即使在内部测试中也要坚持最小必要数据原则并对推断结果做明确标识避免被误当成确定事实使用。7.2 推荐的学习路线如果你想从零开始系统学习这个方向可以参考下面这条路线第一步掌握深度序列模型基础。GRU、LSTM、Transformer 是实现世界模型的底座尤其是序列建模和隐状态理解必须扎实。第二步学习经典世界模型工作。重点看“World Models”和 Dreamer 系列理解隐空间动态预测、模型预测控制、虚拟环境训练这些核心概念。第三步补充认知科学和社会智能知识。阅读心理理论、BDI 框架、意图推断相关内容理解心智建模的理论基础。第四步研究多模态大模型与世界模型的结合方式。了解当前主流多模态模型如何理解视频、图像和文本思考它们能否为心智世界模型提供语义先验。第五步动手做一个合成环境小项目把前面所有知识串起来完整走一遍数据生成、模型训练、评测分析的流程。8. 写在最后心智世界模型目前确实还处在非常早期的阶段数据怎么标、模型怎么练、评测怎么做这些问题都没有公认答案。但也正因为方向年轻现在参与进来的开发者都有机会定义它的基础问题。如果你对这个方向感兴趣我建议从今天开始关注牛津和 NUS 团队的后续公开进展同时自己动手搭一个最简单的“带隐藏目标的网格世界”实验。把物理预测和心智预测放进同一个模型里训练一次你对这个方向的理解会比读十篇综述都更深。等到官方代码和数据集开放时你已经有了可对比的基线那时再切入就会从容很多。