NEO系列路线图前瞻:从NEO到NEO-ov再到NEO-unify的端到端统一多模态演进 📅 发布时间:2026/8/24 9:56:39 👁 浏览次数: NEO系列路线图前瞻从NEO到NEO-ov再到NEO-unify的端到端统一多模态演进【免费下载链接】NEONEO Series: Native Vision-Language Models from First Principles项目地址: https://gitcode.com/gh_mirrors/neo32/NEONEO 系列是一套从第一性原理出发的原生视觉语言模型Native Vision-Language Models本文将带你完整梳理 NEO → NEO-ov → NEO-unify 三阶段的演进路线如何从像素直接到文字、如何实现单视觉流的视频与空间智能理解、又如何走向端到端统一的多模态大模型。无论你是多模态新手还是研究者这份路线图前瞻都能帮你快速把握这条去编码器技术路线的全貌。️ 一图看懂 NEO 路线图三个关键里程碑NEO 系列不是一次性发布的单点模型而是一条持续演进的多模态演进路线图时间线非常清晰阶段时间里程碑核心突破NEO2025/09 完成2025/10 发布论文、2B/9B 权重、评测代码验证原生像素到文字路线的可行性ICLR 2026NEO-ov2025/12 完成2026/01 放出训练代码2026/05 发布One-Vision 单视觉流架构统一单图、多图与视频理解空间智能大幅跃升NEO-unify2026/02 技术博客2026/04 技术报告端到端原生多模态统一模型统一理解 生成落地为 SenseNova-U1 为什么是原生NEO 从第一性原理出发的核心主张传统视觉语言模型普遍采用模块化设计——视觉编码器 语言模型中间靠对齐模块拼接。NEO 团队提出了两个根本性问题原生视觉语言模型相比模块化模型到底受哪些约束限制这些限制能否被克服如何让原生模型更易获得、更民主化从而加速整个领域进步NEO 的答案是去编码器encoder-free的密集模型架构图片被切成 patch 后经Patch Embedding Layer直接嵌入文字经Word Embedding Layer嵌入两类 token 统一进入同一个 Transformer 完成编码、对齐与推理。关键设计包括Pre-Buffer 前缓冲层复用预训练语言模型的权重视觉能力通过少量可复用层注入大幅降低训练成本原生 3D-RoPE为图像/视频帧的高宽时序关系设计多维旋转位置编码高效训练仅用不到 10% 的图文数据从零训练出媲美顶级模块化模型的视觉感知能力模型结构实现可参考源码目录 VLMTrainKit/neo/model/其中 modeling_neo_chat.py 与 modeling_neo_vit.py 分别对应聊天接口与视觉嵌入部分的实现。 NEO验证路线可行性的起点2B / 9B第一阶段 NEO 发布了2B 与 9B两个尺寸、覆盖预训练PT、中训练MT、监督微调SFT各阶段的完整权重让社区可以低成本复现并研究原生架构。在单图理解基准上NEO 以任意分辨率输入和原生 RoPE 的组合在 MMMU、MMStar、OCR VQA 等多项指标上与同级别模块化 VLM 正面交锋部分榜单取得领先。评测代码基于 VLMEvalKit 定制覆盖知识推理、通用 VQA、OCR VQA 与幻觉检测共 13 个基准入口见 VLMEvalKit/run.py 与 VLMEvalKit/README.md。 NEO-ov一个One Vision流通吃多图、视频与空间智能如果说 NEO 证明了原生路线走得通NEO-ovOne-Vision则回答了原生路线走多远。它把单图、多图、视频全部纳入同一条视觉流不再为不同输入形态维护不同的处理管线这也是其名称中ov的含义。效果在两大方向上尤其明显1️⃣ 多图与视频理解—— 视频基准Video-MME、MVBench、LongVideoBench、Video-MMMU 等 6 项上稳定追平并超过同级开源模型2️⃣ 空间智能—— 12 项空间推理基准VSI-Bench、MMSI、MindCube、SITE、SPAR 等上显著领先例如 9B 版本在 MindCube-tiny 上达到 90 分体现原生 3D-RoPE 对空间/时序关系建模的红利NEO-ov 的评测套件支持图像12 项、视频6 项、空间智能12 项三大类共 30 个基准一键脚本包括 eval_image.sh、eval_video_part1.sh 与 eval_si.sh完整说明见 VLMEvalKit_ov/README.md。 NEO-unify迈向端到端统一的多模态大模型路线图的第三站是NEO-unifyBuilding Native Multimodal Unified Models End to End。前两步分别解决了理解侧的原生化与统一化而 NEO-unify 进一步把理解与生成统一进同一个原生端到端框架——不再用理解模型 生成模型的拼接方案而是让一个模型原生地同时完成多模态理解与内容生成。2026/02NEO-unify 技术博客发布阐述端到端统一训练的设计与收益2026/04基于 NEO-unify 架构的SenseNova-U1技术报告发布标志着该架构从研究原型走向可落地的统一多模态产品级模型对使用者的意义很直接未来围绕 NEO 生态的组件训练框架、评测套件、复用组件可以持续复用到统一模型上生态成本被摊薄。️ 新手快速上手指南NEO 生态的三大件想在本地玩转 NEO 系列仓库提供了三块开箱即用的拼图模块作用关键入口VLMTrainKit训练框架从零预训练、中训练、SFT 全流程VLMTrainKit/neo/train/train.py、VLMTrainKit/README.mdVLMEvalKitNEO 图像理解评测13 基准VLMEvalKit/README.mdVLMEvalKit_ovNEO-ov 图像/视频/空间智能评测30 基准VLMEvalKit_ov/README.md训练侧的几个实用特性值得新手关注Packed 数据打包训练多条样本拼入一条序列最大化 GPU 显存利用率数据采样率控制数据集名后加%50即可只用一半数据方便快速实验训练脚本模板scripts/2B_1PT.sh 到 scripts/8B_3SFTsi.sh 覆盖了 2B/8B 各阶段的分布式训练配置数据格式只需 JSON 两字段imageconversations上手门槛极低 路线图小结一条主线三个台阶回看整个演进NEO 系列其实只在做一件事——不断把多模态塞进同一个原生端到端模型里NEO像素 → 文字验证无编码器原生路线成立NEO-ov单图 → 多图 → 视频一条视觉流统一所有空间/时序输入NEO-unify理解 → 生成一个模型端到端统一多模态感知与创造。对新手而言建议先跑一遍 VLMEvalKit_ov 的评测脚本建立对基准的体感再用 VLMTrainKit 的小规模 SFT 实验感受训练流程——这正是 NEO 团队所倡导的让原生模型可及、可复现、可扩展的完整闭环。【免费下载链接】NEONEO Series: Native Vision-Language Models from First Principles项目地址: https://gitcode.com/gh_mirrors/neo32/NEO创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考