给判断模型装上身体:Jev 接入硬件的两条路,与 VLA 画过的地图
一个纯文本、无视觉的商业 API正在被人接进控制回路。它凭什么接上、接在哪一层、错了会怎样——这三个问题恰好落在计算、信息、误差三种结构上。而机器人界已经提前三年把答案的草稿写好了写在 VLAVision-Language-Action的论文、蒸馏实验和一次次真机事故里。本文以接入硬件的三问为轴Jev 是线索VLA 是第二主角。开篇一周之内长出身体2026 年 9 月 15 日TypeSafe AI 发布了 Jev一个不提供权重下载、只暴露托管 API 的System One 模型。它不收图像、不收音频输入文本或结构化程序状态输出三种类型化的判断——Choice在最多 255 个候选中选一个、Score打分、Noul是/否概率。它不生成任何字符串。官方在发布材料中说明类型错误率为 0% 源于结构保证而非实测——答案空间由调用方声明非法取值在结构上不存在。官方另有实测数据的是速度与成本口径下文另述。这不是一个为机器人准备的产品。但发布后的十天之内按各项目仓库创建时间核验9 月 16–22 日社区自己干了这件事一架 Skydio X2 四旋翼MuJoCo Menagerie 里的真机模型在仿真里仅靠机载相机飞完五站障碍赛道一个判断模型以约 2.5Hz 的频率坐在战术层上决定当前局面的含义——爬过去、等转门、穿缝隙——而所有时间敏感的控制留在普通代码里。一条 Franka 机械臂在 ManiSkill 仿真里听懂零样本英文指令pick up the red cube靠同一个 API 在约 30 个硬编码基元之间选路。一个智能体在《我的世界》原版服务器上打完了末影龙全程 131 次 Jev 决策、35 次大模型规划调用。另一个项目在 PyBoy 模拟器里用真卡带打《宝可梦 红》每个战斗回合让模型对本回合是否会濒死给出 Noul 概率再用 Brier 分数对着模拟器 RAM 里实际发生的事校验——作者特意没有发布校准结论因为标注样本只有 5 个一个基于这种样本的 Brier 分数只是装饰。这些项目没有一个等待官方做具身功能。一个为软件路由设计的判断模型被社区自行接进了物理回路。这个抽象比它的设计目标更通用。提示下文引用的所有社区项目数字均为作者自报且全部运行在仿真或模拟器内没有真实硬件闭环厂商TypeSafe数字只在对照的语境中出现并标注口径凡属本文的架构推断一律明确标注推断。第一幕计算结构——云端回路的频率预算一个被迫穿 JSON 外壳的分类器先看一个被忽视的事实当你让一个普通的自回归大语言模型做分类——比如这个工单该进哪个队列——它被迫生成一段 JSON 或一个单词来交出答案。它的延迟结构是T prefill n_decode × stepprefill 是输入的一次前向n_decode 是解码步数每步以序列方式依赖上一步。对于输出一个枚举值这种任务n_decode 通常在 10–30 步之间且步数取决于答案内容——模型要输出{queue: refund}还是更长的结构、中途是否啰嗦、是否要复核都会改变延迟。更糟的是 JSON 外壳本身解析可能失败校验可能拒绝重试加倍方差。这里值得给内容方差一个具象的量级。发布博客的对照表里前沿模型的端到端响应被写成 3 到 329 秒厂商整理的口径涵盖不同推理档位——同一个问题模型想多说几句和直接给答案之间隔着两个数量级。即使用结构化输出约束、函数调用模式把长尾砍掉解码步数仍由答案的措辞而非答案的语义决定。对软件集成来说一个延迟有方差的组件是不可签约的——你无法围绕它设计时序保证就像你无法围绕一个有时三秒有时三分钟的函数设计实时系统。这就是LLM 慢这句话真正应该有的精确形式问题不在均值而在延迟是答案内容的函数。Jev 的算法本质此处有厂商口径与推断的混合官方博客描述为parallel sampler所有输出在单次查询内并行算出第三方与社区普遍认为推断其实现是一个骨干网络加声明空间上的小 softmax——答案空间由调用方在请求时声明模型对声明集合内的每个候选算一次前向得分。无论内部细节如何TypeSafe 尚未发布架构论文其延迟结构清晰一次前向答案长短不影响步数方差坍缩。这不是把 LLM 优化得更快而是把串行依赖从延迟公式里删掉——删掉的是答案内容对延迟的依赖网络依赖原封不动抖动仍在账上。这个区别是下一节频率预算的存在理由图①两条路径的延迟结构对比。频率预算能闭合的回路上限是个位数 Hz现在算硬件回路这笔账。Jev 是云端 API。把一个云端 API 放进控制回路延迟预算是T_loop T_api T_network(往返) T_jitter厂商宣称的端到端响应是 70–500ms厂商口径官方博客自述其评测一般跑在我们西海岸的笔记本上即不含跨洲公网Laya 发布方 Convai 的对比表测得 Jev 单题 p50 为 236–276ms竞争方口径宝可梦项目经 Vercel AI Gateway 自报中位 621msn6。加上网络往返与尾延迟一个云端判断回路能稳定闭合的频率上限是个位数 Hz。由此推出一个比快不快重要得多的结论split-rate 是唯一合法架构。jev-drone 的分工是教科书式的——HUD 上写着control 500Hz jev 3HzREADME 口径约 2.5Hz判断模型坐 2–5Hz 的战术层负责这个局面意味着什么姿态、避障的硬约束留在数百 Hz 的确定性代码里。jev-drone 的 2.5Hz 不是随意选择的风格而是上面那笔频率预算的产物。换个 API、换个网络这个数会变预算公式不会。这笔预算在 jev-drone 的消融实验里能看到全部含义自报仿真。同一套系统关掉 Jev、退化为朝宽敞一侧飞的贪心启发式永远不撞也永远过不了第二关——因为从障碍上方爬过去不在它能表达的语义里三次运行全部停在 17.7 米处。接入判断之后全程 77.5 米约 47 秒飞完极速 3.6 m/s目标保持视野率从约 19% 升到 82%被反射逻辑钉死的时长从 65–71% 降到 9%碰撞为零。注意这组数字的结构判断模型贡献的是语义这个情况意味着该爬过去代码贡献的是可靠爬的执行、不翻机的姿态。频率预算决定了两者不能合并成一层。仿真还逼作者写下了两条控制器教训值得单独引用。四旋翼无法向下推、硬指令下降时控制器会忠实地命令一个倒置姿态修法是钳制期望加速度的 z 分量侧向控制需要位置回路而非速度保持否则飞机会一本正经地横穿走廊撞进对面墙。这两条教训里没有任何 AI——它们说明物理层面的正确性永远属于代码判断模型无论多聪明都坐在一个先把 a_des[2] 钳正的世界里。还要补一刀无线链路下抖动失控云端回路在真实飞行硬件上基本出局——jev-drone 自己也承认这是仿真。仿真与有线工作站是云端判断回路的合法疆域出了这个疆域结构就变了。与 VLA 同构用结构换串行机器人界早就面对同一个问题。VLA 的两代关键工作本质都是用结构换串行RT-22023把机器人动作离散化成 256 个 token嫁接在 PaLI-X / PaLM-E 的视觉语言骨干上——动作空间被压进词表才谈得上用预训练模型直接出动作OpenVLA20247B沿用动作 token 化并用投机解码把 wall-clock 吞吐拉高数倍——用一个小草稿模型预测动作 token、大模型并行验证用架构技巧绕开解码串行性更新的FAST动作分词器、π0的 flow-matching 解码器则是在另一侧做同样的事把连续动作的表达改写到推理更便宜的坐标系里。Jev 把这条路推到极端不只动作 token 化而是答案空间整体由调用方声明。VLA 界换的是串行的步数Jev 换的是串行的存在性。把三件事并排看结构就清楚了换掉的串行代价谁掌握声明权投机解码大模型的部分解码步一个小草稿模型 额外显存模型方动作 token 化连续动作的表达自由度动作分辨率与词表设计模型方Jev 式声明答案空间解码本身放弃字符串生成调用方最后一行是那个真正的范式转移历史上是模型方决定答案能长什么样Jev 把这份权力上交回代码。这也是它与 VLA 天然互补而非竞争的根因——第三幕会回来讲这个分工。第二幕信息结构——没有眼睛的感知硬事实Jev 无视觉Jev 无视觉、无音频输入只收文本与结构化状态。官方发布博客在 Doom 演示的脚注里留了一句 not on images (yet…)——截至发稿2026 年 9 月 23 日这个省略号没有产品化下文无图像模型、无接口、无时间表。CEO 在市政厅会议中提到过图像模型但早期访问的公开 API 仍然是文本进、类型化判断出。这不是小遗憾而是信息结构上的根本定位Jev 只负责判断不负责感知。社区的标准解VLM 做前端Jev 做判断代码做动作社区给出的模板高度一致而且和 VLA 界的分层不谋而合像素 → VLM/CV 压成结构化状态 → Jev 判断 → 代码执行动作两个代表性项目皇室战争clashroyale-jev自报仿真Qwen 看战场画面给出局势描述本地 OpenCV 读手牌与圣水数值二者压成结构化状态后交给 Jev 选牌与落点。VLM 与 Jev 是上下游不是替代关系。OmniJev自报仿真双相机图像加文本直接喂给一个自托管的多模态模型以 Jev 式有限选择接口输出下一个预设技能驱动 MuJoCo 机械臂完成搬运、堆叠、越障任务。它最有趣的数字不是成功率而是拒答对不可观测的输入系统返回 insufficient evidence 而不是猜——发布方报告 208/208 个非音频探测请求回答正确并在四个公开基准试点上保持准确率不降、决策延迟降 6.8–13.6 倍、总 token 降 51–86%。这个拒答的分量值得单独掂量。一个会说自己证据不足的回路组件比一个永远给出答案的组件在安全结构上的价值高得多——这是第三幕的伏笔也是校准问题的前奏。更激进的路线原生多模态复现还有一条更激进的路线已经开花决策模型的视觉版率先出现在开源侧而不是 TypeSafe 官方。三个项目值得记住Visual-JEV基于 Qwen3.5-4B 的原生多模态 Jev图像直接进不需要模态转换DohnutsQwen3.5-0.8B图文单前向发布权重、训练代码与评测权重限非商业研究Qwen3.5-OneForward这类接口实验不做训练直接从 Qwen3.5-2B 的 logits 读出 Jev 式类型化选择一次前向、零解码、零微调——同时坦承候选概率未经校准。这个分叉本身值得一段分析。官方产品选择先校准后多模态闭源 API 要卖的是概率可信度开源社区选择先多模态后校准复现者先证明形态可行校准是后补的工程。谁对谁错没有答案但它说明判断与感知的解耦是市场的选择不是某家公司的设计。这个解耦还有一层更深的含义感知压缩这一层恰好是整个系统里误差最容易失控的地方。Qwen 看战场会漏看一条炮线OpenCV 读圣水会读错一位数而 Jev 拿到的是已经定型的状态——它甚至不知道自己不知道。判断层的校准做得再好也只是给定输入下的诚实输入本身错了诚实的概率照样通向错误的动作。这正是三前提定理把感知已压缩列为第一条的原因也是 OmniJev 把证据不足就拒答看得比准确率数字更重的原因——拒答是信息结构里唯一能对感知失效做出反应的机制。顺带澄清一个流行的误读Jev 不是 YOLO 式的固定标签分类器——答案空间不是训练时写死的类别表而是调用方在每次请求里动态声明的候选集合动态标签空间才是准确的说法。它与抽掉语言模态的 VLA 模型反而共享更深的结构RT-2 与 OpenVLA 的骨架本来就是视觉 → 离散动作 token把语言部分拿掉剩下的正是感知压缩状态 → 声明空间内的类型化单选。Visual-JEV 与 Dohnuts 实际上就长在这条缝里——这个类比点到为止展开是另一篇文章的事。概率合约的拷问softmax 的三种语义现在进入本幕最硬的部分。当 Jev 卖出带校准概率的类型化判断它卖的到底是什么softmax 输出的概率有三种常被混用的语义策略似然在模仿学习坐标系下概率是专家这么做的相对可能性置信感模型内部几何给出的锐度是隐空间的副产品没有外部含义校准概率频率主义含义——模型说 70%长期看在可比情形下就应命中约 70%。三者的差别不是学术洁癖。策略似然适合行为克隆置信感适合排序检索只有校准概率能进阈值逻辑p 0.85 就自动执行这个 if 语句只有当 0.85 是第三种语义时才成立。Jev 宣称卖的就是第三种训练方法 RLCDReinforcement Learning for Calibrated Decisions的名字就是承诺。但反方证据同样公开Laya 的自测表给出 ECE期望校准误差0.081 对 0.246Laya 是 Jev 的开源竞争者整表是竞争方口径不可当作中立评测。逐数字拆开看测量方与对象0.246 是 Laya 一方测 Jev 的原始口径0.081 是 Laya 自测、经按问题类型×选项数温度重拟合之后的数字——两者并非同一测量条件下的对比。第三方综述给出同口径的原始数字Laya 基础检查点原始 ECE 0.213Jev 原始 ECE 0.144结论反转。同一组数据两种口径结论反转——这就是校准这个词在商品页上的实际处境。一个独立项目在合成锦标赛任务上实测jev-1.13.031 场比赛自报ECE 0.197且明确标注过度自信gap 0.174Brier 还输给了 Elo 基线。作者的态度是测出错误校准是这个项目的意义所在不是 bug。竞争格局里还有两组数字把校准战争的全貌补完。准确率战场上竞争方口径下 Laya 在 typed-decisions0.766 对 0.727、AG News0.950 对 0.910、情绪分类0.595 对 0.480上领先而 Jev 在高基数任务 Banking77 上以 0.870 对 0.425 碾压——选项一多encoder 式架构的打分头就力不从心。能力边界上Laya 官方坦承其基础检查点零样本接近随机0.362低于多数类基线 0.461能力来自微调而非底座。这些互有胜负的数字提醒读者所有对比表都是某一方在自己选的地形上打的仗。最精巧的技术回应来自 Verdict 2.0作者自报未获任何独立验证此处仅作方向性参考它把概率拆成两个通道——分布头去拟合人类专家面板的软标签Brier 0.0636另训一个置信头专门预测这次对不对ECE 0.0144AUROC 0.7664。这实际上承认了软分布匹配和二值正确率校准在数学上互相冲突一个模型没法同时最优地服务两种语义。把两种语义拆开卖大概率是这类产品下一步的标准做法——Jev 的单通道置信度届时会显得简陋。更深一层的问题校准是分布内性质。ECE 在和校准集同分布的数据上测量才有意义业务一漂移softmax 的几何被拉伸昨天的 0.85 阈值今天可能意味着 0.6 的实际命中率。这不是 Jev 的缺陷是所有判别式模型的数学宿命。放进学术坐标系这里有两棵老树。Selective predictionEl-Yaniv 一脉2010 年起研究的核心对象就是拒判率—风险曲线分类器可以拒答换取被接受样本上的错误率下降曲线之下的面积刻画的是一个模型的可自动化程度。这条线的现代含义是一个永远给出答案的模型和一个知道自己何时该闭嘴的模型在自动化坐标系里是两种东西——Jev 的置信度加代码阈值本质就是把这条曲线做成了 API官方博客里always communicates confidence and uncertainty with every output翻译成学术语言就是暴露了选择性预测的接口。但它给出的是曲线不是证明阈值调到多少、曲线在你的分布上长什么样是调用方的责任不是 API 的承诺。Conformal prediction是另一条路不假设模型校准只在数据可交换的弱假设下用校准集的分位数构造预测集合给出 coverage 的有限样本保证。机器人界的KnowNoRen et al., CoRL 2023是这条路在 embodied 场景的范本LLM planner 对候选动作给分conformal 量化出一个预测集合集合不唯一就向人求助在保证任务成功率的前提下把人工求助量降低了 10–24%并上了真 UR5 机械臂。对照之下KnowNo 与 Jev 的对应关系有多整齐多选帧对应声明的答案空间预测集对应证据不足的拒答人工求助对应代码兜底——只是 KnowNo 多了一样东西一个关于成功率的定理。这就是判断模型类产品与学术传统之间真实的距离刻度盘已经有了保证书还差一层共形预测包装。一句话收束本幕Jev 把何时该说不知道这个学术老问题工程化了但工程化不等于解决——它给了你刻度盘没给你保证书。图②校准的分布内性质与漂移失效。第三幕误差结构——错了会怎样误差的可消费性取决于是否复合现在回答最尖锐的一问判断模型错了会怎样答案不在模型里在回路结构里。先算一笔复合账一条每步成功率 99% 的回路以 20Hz 跑十秒即 200 步累计成功率是 0.99 的 200 次方——约 13%。要让十秒后还剩 87%单步成功率得达到 0.9993。这就是复合误差的铁律局部的高可靠在串行回路里指数蒸发。而 Jev 的用例恰好是误差不复合的那类每一次判断都有状态反馈兜底——选错技能下一步的状态会不同判断可以重来选错分支宝可梦的战斗回合会给出新的 RAM 事实。误差被吸收在回路的反馈里而不是沿着轨迹累积。这是用例筛选的结果不是普适能力。这里要堵住一个容易混淆的追问jev-drone 的贪心基线也运行在同样的状态反馈里为什么它的失败像复合误差而判断层的误差不像区别在于错误的性质。复合公式管的是高频回路上的单点失败沿着物理轨迹累积判断层的错误是低频的决策错误且每帧都能重选单点错误至多损失一拍。基线的失败不是随机误差的累积而是系统性语义盲区——它没有重新选择这个机制每一帧都在忠实地重复同一个错误策略三次运行整齐地停在同一坐标。换言之是否可恢复取决于错误进入的是一条只能前向执行的物理链还是一个每帧重新开盘的决策点。图③柱 单步 99% 且逐步复合的回路200 步即十秒时只剩约 13%线 单发判断、误差不复合每次判断独立接受状态反馈校验。横轴为步数。三前提定理为什么这些项目的误差不复合拆开看它们全部满足三个前提感知已被压缩成结构化状态——Jev 收到的是 xyz 坐标、布尔量、候选清单不是原始像素感知误差在进入判断之前已被代码或 VLM 定型技能库已硬编码——候选集合是 10–30 个互斥、可验证、可由确定性代码执行的原语模型选择的后果有界安全回路在确定性代码里——姿态稳定、力矩限制、急停全部不经网络、不经模型。缺一不进回路是修辞准确的说法是缺一回路的风险结构质变。这条定理不是数学定理是工程排他律缺了第一条判断在噪声上拍脑袋缺了第二条错误选项本身不可执行或不可控缺了第三条任何单点错误直接变成物理事件。三条齐备时误差只是可恢复的判断错误缺一条它就变成需要自己背书的系统风险。这里必须明确排除一个常被混淆的对象PID。PID 有稳定性保证、跑在 kHz、不依赖网络——它是 Jev 下方的层不是被 Jev 替代的层。判断模型坐在它上面像飞行员坐在飞控上面自动驾驶仪不取消飞控判断模型也不取消 PID。图④四层下放框架。越往上频率越低、抽象越高、误差越不直接变成物理后果。生态实证与一段冷水生态项目几乎按图索骥jev-askable-arm自报仿真ManiSkill 里的 Franka Panda约 30 个互斥基元Jev 每步选一个、PD 执行器驱动pd_ee_delta_pos执行约 1 秒一次选择。README 里那句Jev never outputs torques or a trajectory是三前提定理的白话版。quackd自报一个给真实机器人用的 CLILLM 当飞行员Jev 是可选购步器--jev off为默认shadow 模式只记录不干预——它只回答在机器人已声明技能中选择这一类轮次README 里的比喻意译它写出关节角的可能性不会比一支温度计更高。它的仓库创建于 8 月 28 日比 Jev 发布早九天——这个机器人 CLI 本来就存在Jev 上线后一周内作者主动给它装上了可选的判断步器。《我的世界》智能体自报仿真前沿模型负责规划Jev 负责选择每一个玩家动作131 次 Jev 决策对 35 次规划调用——约 3.7:1 的配比是层级架构优于单体模型的直接证据便宜的判断做高频选择贵的推理做低频规划。RoboJEV自报仿真Franka Panda 抓取/推/堆叠每次决策重发整个场景 JSON完成一个任务花了 244 次请求——这个数字本身就是云端路线的隐性成本状态不缓存、轨迹不复用调用量随任务长度线性膨胀。EmbodiedJev自报仿真实测评测MuJoCo 工作台把每个机器人步骤做成可见的 Jev 决策有第三方评测记录到一次 gate 中途触发——两个选项停在 0.54 和 0.44机械臂停下等人而不是猜。评测者把这列为无人值守需要刻意调阈值的注意事项但从误差结构看这正是设计目标回路的最后一道闸在代码里由概率驱动。jev-libero自报仿真每个候选动作先在物理引擎的可逆分支里预演再问 Jev 选——先预览、后选择把技能的执行后果也变成了确定性知识是三前提定理的强化版不只候选被硬编码连候选的物理后果都被代码穷举过。泼冷水段落集中交代一次以上项目全部自报、全部仿真、无真实硬件闭环部分项目的成功率是单次种子运行而非统计结论quackd 面对的甚至是真实机器人但 Jev 路径尚未见其真实硬件评测。把仿真成绩外推到物理世界中间隔着本幕说的那堵墙。VLA 的旧地图机器人界趟过同一条路而且留下了更完整的记录。对照着看Jev 社区现在经历的每个阶段都有草稿Jev 社区正在经历的VLA 界对应的一页判断模型接入控制回路大模型规划器 低层策略的层级架构SayCan, 2022动作/技能 token 化、候选集合声明RT-2 / OpenVLA 的动作离散化与词表化快慢回路分层500Hz 控制 / 2.5Hz 判断经典机器人学的 split-rate 控制与行为树置信度阈值 拒答KnowNo 的 conformal 求助与 selective prediction云端 API 先进回路做概念验证VLA 先在工作站推理再蒸馏小模型上机差异只有一处但决定一切误差代价。VLA 的错误物理复合——抓错一次杯子碎了抖动失控飞机撞了——而且机器人没有转人工的退路求助本身就是任务失败的一种。Jev 的用例误差被反馈吸收、被拒答拦截、被代码兜底所以它能先卖概率、后补证明机器人界必须先有证明才允许概率进入回路。同一张地图不同的行军纪律。这张地图对从业者还有一个反直觉的启示VLA 界花最大力气攻的问题——端到端、单模型、全频带——恰好是判断模型路线不需要攻的问题。层级、解耦、慢思考骑在快控制上这些被某些人讥为不够端到端的结构正是判断模型一周内被接进物理回路的原因。架构之争里没有洁癖的位置只有误差结构的账。第四幕路线之争——云端接入与边缘复现独立成幕因为这是一条岔路而且是所有从业者真正要站队的岔路。云端接入硬件现状与上限云端路线的可行域由第一幕的频率预算严格划定仿真 有线低延迟链路 个位数 Hz 战术层。它的优点是结构性的按次计费、零运维、模型静默升级jev-latest别名会自动指向新版本——这既是便利也是校准噩梦阈值是按旧版本调的是概念验证的最短路径。一个周末就能让四旋翼飞起来这是云端路线真正的竞争力。它的上限同样结构性。第一是连接无线真实硬件出局。第二是校准的不可复现性你测的是服务方的权重不是你能固定的权重——而jev-latest这个别名会在代码不变的情况下悄悄指向新版本你在旧版本上调好的 0.85 阈值可能在新版本上意味着完全不同的实际命中率官方自己的文档建议阈值已校准就钉死版本号如jev-1.13.0这句话等于承认版本漂移与校准承诺之间存在张力。第三是成本随调用量线性增长jev-drone 类项目每小时数百次决策是零花钱宝可梦项目自报约每小时 0.14 美元约 725 token/次、每秒 1.3 次决策的口径Doom 演示那种每秒 10 次查询就是每小时约 7 美元厂商演示口径——再往上一个数量级账单本身就是架构约束RoboJEV 那一个任务 244 次请求的形状在这种负载下会迅速变得难看。边缘复现门槛不是大小是校准与可审计Jev 闭源、不能上机没有机载算力会为一个每次往返数百毫秒的云端依赖买单。但它的形态足够小小到一个周末就能复现——复现者们已经达标Laya421MModernBERT-large 骨干Apache-2.0T4 单题 32.8ms支持本地与离线环境但出厂检查点过自信须按问题类型×选项数做温度重拟合后才达到其宣称的 ECE 0.081且官方坦承基础检查点零样本能力接近随机0.362低于多数类基线 0.461能力来自微调NanoJev0.6B本地决策头发布训练代码与游戏 demo面向教学与验证Verdict151Mencoder 架构CPU 35ms、浏览器 WebGPU 89ms带显式__insufficient_evidence__拒答槽作者同样诚实地公布短板——337 例 TypeSafe 公开基准上 Verdict 只有 48.1%远低于 Jev 的 90.8%原因是 151M 的 encoder 没有世界知识对流水线里给昂贵模型看门的廉价模型这个边界仍然可用Dohnuts0.8B原生多模态图文单前向权重限非商业研究。一个反复出现的模式上机的门槛不是模型大小是校准质量与可审计性。Laya 与 Jev 互指对方 ECE 难看0.246 对 0.081 的竞争方口径原始口径又是 0.144 对 0.213 的反转——这个互相矛盾的打分数本身就是分水岭所在没有哪一方握有可信的第三方校准审计而机载部署恰恰最需要这个。延迟早已不是瓶颈31 字节的答案和 30 微秒的推理都不是问题问题是系统说它 92% 确定时我该不该信我拿什么审计。Verdict 的浏览器 WebGPU 演示在这个语境下意味深长推理直接跑在你自己的浏览器里输入、候选、原始概率全部可见还能导出可验证的 JSON 推理回执。这未必是性能上的最优解却是可审计性的一个极端形态——审计的第一步是让每个决策可回放、可复算。开源复现们在这一点上对闭源 API 构成的不对称优势比任何延迟对比表都致命。也别把边缘路线浪漫化。它的隐形成本在校准之外Laya 要按问题类型×选项数做温度重拟合才有可信概率基础检查点零样本接近随机垂直场景必须自己微调官方 Kaggle notebook 一轮约 4–5 小时看着不贵但数据标注与评测集建设才是大头Dohnuts 的权重限非商用Visual-JEV 们还没有任何公开校准证据。云端路线卖的是即插即用的可信度边缘路线买的是自己负责的可信度——选哪条取决于你的团队里有没有人对校准负责。由此第四幕真正的分界线可以比云端 vs 边缘再往下挖一层校准优先还是形态优先。TypeSafe 的排序是先有可卖钱的概率可信度、再谈多模态闭源 API 的估值锚在校准上开源社区的排序是先证明单前向 图文输入的形态成立、再把校准当后补工程Dohnuts 放训练代码、Verdict 做拒答槽都是补票动作。这不是工程约束之争是安全策略之争先校准意味着不证明不进回路先形态意味着先进回路再补证明。两条排序各自有商业逻辑但请注意它们在 VLA 史上的对照组是谁——机器人界当年整体选择了前者代价是三年判断模型界正在同时跑两条路线谁对谁错会是这个品类三年内最值钱的答案。至此全文的三层二分可以摆齐了误差是否复合第三幕取决于用例部署路线云端还是边缘本幕取决于频率预算与所有权衡而校准优先还是形态优先是比这两者都更底层的一层二分——它左右你选哪条部署路线更决定你愿意为证明付出多少前置成本。标题说的是路账本的根子在排序上。镜像 VLA 史把 VLA 史叠上来两条线的重合度高得惊人OpenVLA 7B 走云端/工作站蒸馏小模型上机——就是 Jev 与 Laya/NanoJev/Dohnuts 的关系RT-2 当年也只能在机房推理两年后才轮到 π0、Octo 这一批讨论机载与边缘。历史给出的预判是概念验证走云端生产闭环归边缘中间隔着一道安全案例的墙——对机器人安全案例是功能安全论证与事故责任对判断模型是校准审计与版本冻结。两界谁都没翻过去。图⑤云端—边缘谱系图。两条平行线同一堵墙。对比表维度云端接入Jev API边缘复现Laya / NanoJev / Dohnuts / Verdict回路延迟数百毫秒级 网络抖动闭合上限个位数 Hz数十毫秒本地前向抖动可控成本按次计费输入 $0.042/百万 token输出免费零运维自托管近乎为零但训练/微调/校准是隐形成本校准出厂宣称已校准RLCD但你无法在自己分布上复核自己拟合、自己测可审计但出厂常过自信可控性权重不可见、版本会漂移jev-latest别名权重在手、版本可冻结、可离线代表项目jev-drone、askable-arm、宝可梦红、Minecraft 智能体Laya、NanoJev、Dohnuts、Verdict、OmniJev五行收束本幕云验证概念边缘拿生产分水岭是校准不是延迟。浮出回到最初的三问现在可以给答案了。凭什么接上因为判断模型的延迟结构里删掉了串行依赖——快不是本体是副产品。真正被卖掉的是可签约性延迟方差坍缩、输出结构保证代码第一次能围绕一个 AI 组件设计时序。而这条路的尽头站着频率预算云端 API 只能闭合个位数 Hz 的回路所以它只配坐战术层姿态与安全永远留在代码里。接在哪一层接在感知与动作之间、被三前提夹住的那一层状态已被压成结构化文本技能已被硬编码成候选集合下面有 kHz 级的确定性回路兜底。这不是 Jev 的设计是所有判断即服务进入物理回路时的共同坐标——VLA 界用三年把它画成了地图。错了会怎样在它的合法用例里误差不复合反馈吸收它、拒答拦截它、代码兜底它。所以单发 99% 的朴素可靠度足够消费。出了这个域——进了误差物理复合、没有转人工退路的场景——同一组数字立刻变得不可消费。Jev 敢卖概率是因为它的用例筛过了这是筛选的结果不是普适能力。第四幕补第四句接入硬件的路有两条。云端验证概念边缘拿生产中间隔着校准审计与版本冻结这堵谁都没翻过去的墙。给从业者的两个意见云端试回路的频率预算公式——T_loop T_api T_network T_jitter能闭合的频率上限取预算的倒数再打折先算这笔账再决定判断模型坐哪一层。边缘选型的校准验收清单——在自己的业务分布上测 ECE 与拒判率—风险曲线而不是引用任何人的对比表包括本文按问题类型 × 选项数分层拟合温度冻结版本号拒绝漂移别名把证据不足的拒答路径当成功能而不是瑕疵来测。给研究者的三个开放问题分布偏移下校准的半衰期是多少——业务漂移多快会让出厂校准失效这决定了校准即服务的续费周期决策 API 的 conformal 化——能否在判断模型输出之上包一层轻量 conformal给出有条件的 coverage 保证而不牺牲单前向的延迟结构机载决策模型的安全案例归谁做——模型方、集成方还是第三方审计VLA 界三年没答完判断模型界还没有人开始答。最后一个镜头。9 月 15 日发布的是一个frontier-intelligence function call无身体的判断。十天之内社区替它接上了四旋翼、机械臂、卡带与龙。Jev 未必是赢家——校准争议、闭源形态、竞争方口径互撕都还是进行时——但判断即服务这个品类已经站进了物理回路。值得记住的不是它走得多快而是它走的每一步都落在机器人界二十年画好的那张地图上。地图上最后一堵墙还立在那里而墙两面的人现在是同行。附本文引用与口径说明厂商事实均出自 TypeSafe 官方发布博客2026-09-15及公开 SDK 文档厂商性能数字70–500ms、20–200× 等为官方自述口径官方自认评测跑在其西海岸笔记本上跨洲网络不计入。生态项目jev-drone、jev-askable-arm、quackd、jev-plays-pokemon-red、clashroyale-jev、OmniJev、rmalde/minecraft-agent 等数字均为作者自报全部位于仿真/模拟器环境引用时已随文标注。项目时间线经 GitHub API 核验仓库创建时间jev-drone 9 月 16 日、jev-askable-arm 9 月 17 日、jev-plays-pokemon-red 9 月 18 日、clashroyale-jev 与 minecraft-agent 9 月 20 日均在 Jev 发布9 月 15 日之后十天内quackd 仓库创建于 8 月 28 日早于 Jev 发布属既有项目接入正文已如实区分。Laya 对比数字出自 Convai Innovations 发布的对比表竞争方口径Jev 侧数字引用自第三方基准原始口径与拟合口径的差异已随文说明。学术引用KnowNoRen et al., CoRL 2023, arXiv:2307.01928RT-2Brohan et al., 2023OpenVLAKim et al., 2024Octo / π0 / FAST 等见正文。selective prediction 与 conformal prediction 为标准术语未特指单一文献。文中单前向 声明空间小 softmax等为社区共识与本文推断TypeSafe 尚未发布架构论文已随文标注推断。文中图片分别为 jev-drone、MakerMods 机械臂、双调用搬运项目的公开归档截图版权归原作者所有仅作评论引用。