Veeda完成9000万美元融资,探索物理AI交互式学习新范式 📅 发布时间:2026/8/27 16:05:49 👁 浏览次数: 1. 物理AI规模化的困境与出路物理AI的规模化受限于数据的数量和质量而数据受限于数量和质量的原因又在于获取成本。人类的学习范式是在与环境的互动中不断试错直至成功大语言模型也是跨越了海量文本的被动训练转向交互式任务与反馈才解锁了全新能力。那么如果机器人能通过与世界的交互来学习是否有可能很大程度上解决具身智能数据成本和质量的悖论呢但现实世界目前并不具备让机器人通过试错来学习的可行性因为这不安全、成本高、耗时长。所以要实现交互式学习的规模化机器人必须在模拟现实中学习。2. Veeda的背景与技术探索Veeda AI正在开发用于模拟物理世界的多模态“世界模型”其目标是构建可无限扩展的模拟环境通过高频交互训练具身智能体。它由前NVIDIA研究员、知名计算机科学家Sanja Fidler领衔创立近日完成9000万美元种子轮融资本轮融资由Khosla Ventures与Radical Ventures联合领投。在联合创立Veeda前Sanja FidlerCEO 曾任NVIDIA AI研究副总裁掌管空间智能实验室并共同推动了3D场景合成与生成式AI领域的底层技术突破。联合创始人Zan Gojcic曾任NVIDIA研究总监在神经重建及构建自主智能体训练所需的高保真模拟环境方面造诣深厚。联合创始人Huan Ling曾任NVIDIA生成式AI研究经理后出任某生成式AI初创公司首席科学家在开发复杂系统所需的实时高分辨率视觉合成技术方面具有丰富经验。Zan Gojcic与Huan Ling在NVIDIA期间与Sanja Fidler长期共同研究。Sanja Fidler和团队在参与Omniverse相关工作时发现Physical AI“真正缺失的关键拼图是内容”。团队因此从3D生成和神经重建入手希望把真实世界的数据更快转化为可用于机器人训练的虚拟环境。到后来3D Gaussian Splatting等技术已经可以让研究者扫描现实空间再直接导入IsaacNVIDIA的机器人仿真与训练平台中训练机器人。与此同时他们也看到了传统图形管线的局限Physical AI还需要对智能体和物理进行建模。团队因此探索另一条路线让世界模型直接承担内容创建和世界仿真并基于用户交互生成后续世界。早期的GameGAN已经在尝试让AI替代游戏引擎用户输入动作后由模型生成下一帧 2021年的DriveGAN进一步使用大量自动驾驶视频 2023年团队又把Latent Diffusion扩展到视频随后沿着规模化训练继续发展到Cosmos。在进一步研究中他们面对的问题也逐渐从“怎样生成一个更真实的世界”转向“怎样让这个世界真正成为Physical AI可以使用的仿真环境”。Sanja Fidler在2025年的播客中提到要在现实世界的规模、多样性和真实感下实现可信且物理准确的仿真目前仍没有确定的技术路径。传统物理求解器难以覆盖如此复杂的现实世界生成模型也会出现幻觉、物体消失和穿模。她认为两条路线最终可能需要结合 先用物理求解器对部分效应进行3D仿真再将结果作为世界模型的引导让世界模型进一步生成更丰富的时空场景。3. OmniDreams的验证与Veeda的技术路线2026年6月发布的OmniDreams是Sanja Fidler、Zan Gojcic、Huan Ling创业前的最后一批研究之一。它基于Cosmos进行后训练是一个用于自动驾驶闭环仿真的动作条件化生成式世界模型。它可根据驾驶动作实时生成后续观测与驾驶策略形成闭环并支持数分钟连续推演。NVIDIA还用它进行策略评估OmniDreams对四种驾驶策略的排名与基于真实数据重建的自动驾驶仿真方案NuRec一致开始验证生成式世界模型作为训练和评估环境的能力。Veeda的技术路线和OmniDreams的思路很像为Physical AI构建模拟现实并进一步把这种生成式、可交互的世界从自动驾驶扩展到更广泛的机器人训练。4. 机器人为何需要更多交互式训练Veeda的核心判断是具身智能不会仅仅依靠模仿学习而诞生。正如人类在与世界的互动中不断试错直至成功机器人也必须通过交互来学习物理AI的突破也将由交互式学习驱动。但它认为目前现实世界并不具备让机器人通过试错进行学习的可行性。首先是安全风险高任何失误都可能造成实质性的物理损失。然后成本也高硬件设施与操作人员很难像堆算力一样实现规模化扩展。最后效率也低现实经验无法以学习所需的规模进行加速或并行处理。所以结论就是 要实现交互式学习的规模化机器人必须在模拟现实中学习。5. Veeda的技术链路与解决方案Veeda解决这个问题的方式是构建“多模态基础世界模型”Veeda的这个“多模态基础世界模型”区别于生成视频的世界模型是一个能够接收机器人动作、持续推演环境并最终用于机器人训练和策略验证的世界模型。目前Veeda并没有完整的技术博客介绍他们具体是怎么做的创始团队今年6月都还在NVIDIA做OmniDreams从创始团队之前的工作以及他们的招聘信息中可以大致还原出一条从世界模型训练到机器人策略后训练再到Sim2Real验证的完整技术链路。首先是训练“多模态基础世界模型”。 它的核心包括动作条件化的视频模型和潜在动力学模型采用基于整流流rectified flow的扩散Transformer、块因果自回归混合架构以及因果视频分词器其中视频分词器的压缩比会直接影响模型能够维持多长时间的推演。为了让世界模型能够响应机器人行为Veeda会将推演过程条件化于机器人动作片段和相机轨迹。同时它还计划通过逆动力学和潜在动作模型从没有动作标注的视频中恢复“伪动作”从而扩大可用于训练动作条件化世界模型的数据来源使训练规模不再受限于遥操作数据。在动作条件化之外Veeda还要解决长时程推演的稳定性。世界模型在持续推演中会不断使用自身生成的结果误差也可能随时间累积。Veeda计划通过在模型自身生成的推演结果上训练采用diffusion forcing、self-forcing对抗累积漂移并以3D高斯或点图持久化场景状态使分钟级推演保持连贯。在此基础上Veeda还会利用基于物理约束的奖励模型和验证器进行微调并将模型蒸馏为少步采样器使智能体能够在模型内部以交互速率实时行动。Veeda会兼容现有仿真体系。它的世界模型可以接入Isaac Lab、Carla等现有仿真器API并构建世界模型与策略的闭环机器人策略输出动作仿真环境和世界模型据此继续推演再把新的状态和观测反馈给策略。同时系统还会记录策略运行中的成功和失败案例并通过任务成功率以及与真实硬件轨迹的偏差来评估仿真保真度。此后Veeda会用仿真工具对π0系列、GR00T N等具身智能基础模型的策略进行后训练。最后再把经过仿真训练的策略部署到真实机器人上通过真实实验量化Sim2Real差距评估仿真保真度以及策略经过训练后的提升效果。整条链路总结起来是以下并非Veeda官方披露的完整链路只根据现有信息总结 训练世界模型 → 从视频中补充动作信息 → 解决长时程稳定和实时交互 → 接入现有仿真器形成世界模型与策略闭环 → 对π0、GR00T N等策略进行后训练 → 部署到真实机器人做Sim2Real验证。6. 交互学习物理AI智能提升的新范式现在的具身数据其质量数量和成本都是分层的。 质量较高但成本也很高的是遥操所以数量受限。然后是传感数据比如UMI手持式平行夹爪腕部相机采集和ego可穿戴相机采集第一人称视频它们成本相对低数量相对多。再下一层是生成类数据比如世界模型产生的数据游戏产生的数据。 底层就是互联网视频数据。高质量的数据贵低成本的数据质量低所以行业内例如NVIDIA的一些厂商会用大量低成本数据和少量高成本数据做预训练然后用高成本数据来后训练。这样的效果也不错但毕竟是无奈之举。如果能够同时解决数据的质量和成本问题就能促进整个行业的发展。Veeda是试图往这个方向发展它的表现形式是世界模型和仿真但核心思想是让模型通过交互来学习。包括此前介绍的Reimagine Robotics其技术内核都是通过交互学习只不过它是用在后训练。 通过交互学习可能是AI领域无论是大语言模型还是物理AI模型的下一个范式。这很可能是因为它更符合学习的本质也和人类的学习模式更像。 现在很多neolab押注的RSI递归自我改进包括现在非常前沿的Test-Time Training硅谷有传闻ilya的SSI也在用它交互中学习都是它们会用到的重要方法。在物理AI领域包括各个环节尤其是智能环节其范式都还没有收敛在每一个环节上都还有创新和创业的机会创业者们是否会向这些方向进发呢