GPT-4o与Gemini如何统一多模态?Maths, CS AI Compendium 统一架构完整指南 📅 发布时间:2026/9/17 11:29:12 👁 浏览次数: GPT-4o与Gemini如何统一多模态Maths, CS AI Compendium 统一架构完整指南【免费下载链接】maths-cs-ai-compendiumBecome a cracked AI/ML researcher/engineer with this unconventional textbook covering maths, computing, and ML with intuition.项目地址: https://gitcode.com/GitHub_Trending/mat/maths-cs-ai-compendiumMaths, CS AI Compendium是一本开源的数学、计算机与 AI 综合教材其中第 10 章「Multimodal Learning」完整拆解了GPT-4o 与 Gemini 的多模态统一架构它们如何把文本、图像、音频、视频压缩成一条 token 序列再用一个模型、一套共享权重实现跨模态的理解与生成。本文用最少的公式、最多的直觉带你走通「统一多模态架构」的完整脉络。为什么需要统一多模态架构早期的多模态系统像五间房子里的五位翻译各管一种模态靠墙上的传话口协作而统一多模态架构是一位全能多语者——一个模型一次前向传播同时读懂文字、看懂图像、听清声音、处理视频。统一还有两个硬理由工程上k种模态两两打通最多需要k(k-1)条独立流水线文生图、图生文、语音转写……统一模型把它们收敛为一套系统理论上人类认知里视觉与语言从来不是孤立模块跨模态绑定发生得早且深。共享权重还能让模型跨模态迁移——文本里主语在谓语前的时序模式可以复用到视频里物体先出现再移动的时序推理。从拼积木到原生多模态三种集成深度GPT-4o 与 Gemini 并不在同一个集成深度上教材用一个遥控器类比讲清了这条光谱集成深度代表模型核心思路浅层NExT-GPT冻结 LLM 大脑 冻结的图像/音频专家仅训练轻量投影层用模态信号 token路由到对应解码器中层CoDi各模态保留自己的扩散生成器通过共享条件机制对齐隐空间一次生成图像匹配音频深层Gemini、GPT-4o单模型端到端训练跨模态注意力在预训练中自然生长Gemini从第一天起就多模态Gemini 的 Transformer从预训练开始就吃交错序列——文本、图像、音频、视频 token 混排在一起。文本走 SentencePiece 分词器视觉侧则学习一套类似 VQ 方案的视觉分词器。因为跨模态注意力是在预训练中有机生长出来的而不是事后加装的所以它的跨模态推理能力最深厚——代价也是训练成本最高。GPT-4oo 即 omni 的端到端架构GPT-4o 把所有模态压进同一个 Transformer、同一个预测下一个 token目标音频 → 频谱 tokenspectral tokens图像 → patch token文本 → 子词 token输出侧再由模态专属的解码头还原。它最关键的创新是延迟早期系统如 GPT-4V要靠 ASR → LLM → TTS 三级模型级联GPT-4o 把这串级联整体去掉语音交互因此更接近实时对话。编码器—共享主干—解码器统一架构的骨架把统一模型想象成一座工厂单一装配线共享主干 不同卸货口编码器 不同发货部解码器。原料进厂前各自专业分拣进厂后走同一条传送带模态编码器$E_m$把原始输入变成一串d维嵌入向量。文本是查表嵌入图像常用 ViT 切 patch 后线性投影音频先算梅尔频谱图再过卷积/Transformer 前端共享 Transformer 主干对所有模态的 token 拼接或交错后用自注意力处理——同一个注意力公式只是 Q/K/V 里混进了不同模态的 token。图像 patch token 可以直接看见文本 token跨模态推理不依赖任何额外的交叉注意力模块模态解码器$D_m$把主干输出还原成原生格式文本 token、像素、波形。细节上每个 token 还会加上一个模态嵌入$e_m$类似位置编码但编码的是我是哪种模态让主干知道 token 的出身。多模态 Token 化把图像和声音翻译成token统一架构最大的工程难题是文本是 1D 离散序列图像是 2D 连续像素网格音频是 1D 连续波形视频还多了时间轴。解决方式就是分词tokenisation把一切变成 Transformer 能左到右消化的扁平序列图像有两条路离散派用 VQ-VAE / VQ-GAN 把图像量化成码本索引序列直接当词汇表用连续派用 ViT/CNN 编码器产出连续嵌入再线性投影——Gemini 和 GPT-4o 走的是连续派而 Parti、LlamaGen 这类自回归图像生成器偏爱离散派音频通常转梅尔频谱图再经神经音频编解码器EnCodec、SoundStream 等离散化成层级 token或经可学习编码器连续投影视频在图像分词之上压缩时间维常用3D VQ-VAE量化时空 patch——时间压缩因子至关重要24fps 的原始视频不做降采样会产生多到无法处理的 token。分好词之后各模态 token 用特殊分隔符标记边界交错成一条序列。Transformer 按标准注意力处理整条混合序列分隔符既是边界提示也充当各模态片段的池化点。一个绕不开的设计权衡是token 预算一张图若占 256 个 token而配文只有 50 个图像就吃掉 5 倍上下文。于是有了 token 合并、自适应分词简单区域少用 token、复杂区域多用等技巧来平衡分辨率与上下文长度。四阶段训练配方为什么不能一步到位你不会在教孩子算术之前先教他微积分。 统一多模态模型从随机初始化直接联合训练所有模态实践中几乎无法收敛主流方案是分阶段训练staged training单模态预训练文本主干在万亿级 token 上做下一词预测视觉编码器在分类/自监督MAE、DINO目标上预热音频编码器在语音识别数据上预热跨模态对齐把编码器接到共享主干在成对数据图文对、音频-转写对上做对比或生成式对齐此时编码器可冻结只更新投影层与主干联合多模态预训练解冻几乎全部参数在单模态多模态混合数据上用一个下一词预测目标训练——模型必须预测下一个 token无论它是文本、图像还是音频 token被迫形成真正的跨模态理解指令微调与对齐在多模态指令数据上微调并用 RLHF / DPO 对齐人类偏好。阶段内还要做模态预热防止模态坍缩文本数据量占绝对优势若不控制模型会忘记弱模态。手段包括梯度平衡、数据比例调度与按模态加权的损失。统一架构怎么考主流评测基准一览没有单一指标能衡量能看、能听、能读、能动的模型主流做法是打一套组合拳MMLU57 个学科的知识基线——统一模型学会视觉后不应出现文本能力回退掉了就是灾难性遗忘的信号MMBench20 个细粒度视觉-语言能力维度检验模型是真看懂图还是在走文本捷径SEED-Bench1.9 万道图文/视频选择题专测时序理解与组合推理MM-Vet单题同时要求识别、OCR、空间感知、生成、知识检索多种技能MathVista几何图、统计图表、函数曲线上的数学推理直指多模态思维链能力WebArena / OSWorld等智能体基准以任务成功率衡量长程规划与容错。一个持续的隐患是数据污染模型在 internet 级数据上训练过基准图题可能背过答案严格去重与留出集是必要但不完美的防线。延伸阅读与动手路径想继续深挖统一多模态架构、世界模型JEPA、Sora 类视频预测与多模态智能体可对照仓库中的原始章节统一架构主章节本文素材chapter 10 - multimodal learning/05. unified multimodal architectures.md多模态表征与 CLIP 式对齐chapter 10 - multimodal learning/01. multimodal representations.md视觉语言模型VQA、Captioning、LLaVAchapter 10 - multimodal learning/02. vision language models.md图像/视频分词VQ-VAE、VQ-GAN、3D 量化chapter 10 - multimodal learning/03. image and video tokenisation.md教材总览与章节大纲README.md 所有架构图SVG都放在 images/ 目录下可配合章节原文对照阅读仓库内含 MCP Server还能让 AI 助手把整本教材当知识库来用。总结GPT-4o 与 Gemini 代表了多模态统一的**原生端到端方向一切模态 → 一条 token 序列 → 一个共享 Transformer → 同一个预测目标。与 NExT-GPT 这类拼积木方案相比集成越深跨模态推理越强训练越贵。而分阶段训练配方**正是把理论上的优雅变成工程上可行的关键——这也是 Maths, CS AI Compendium 用直觉先行的方式讲透的核心。【免费下载链接】maths-cs-ai-compendiumBecome a cracked AI/ML researcher/engineer with this unconventional textbook covering maths, computing, and ML with intuition.项目地址: https://gitcode.com/GitHub_Trending/mat/maths-cs-ai-compendium创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考