从ComfyUI到Agent:拆解新一代AI创作工作台核心模块 📅 发布时间:2026/9/2 7:19:05 👁 浏览次数: 现在做 AI 创作的人普遍面临一个很现实的困境出图在 ComfyUI、写文案在另一个对话窗口、图片分层要在设计软件里重新做最后还要手动拼接出一个完整产物。工具链越高级流程反而越碎。如果你是刚接触 ComfyUI、Skills、MCP、Agent 这些概念的开发者想找一套“把 AI 创作链路串起来”的完整方案那这篇文章值得你花 10 分钟看完。本文将以最近社区关注度比较高的 DX-OS 为线索拆解一个内置无限画布、图片分层、ComfyUI、Skills、MCP、Agent、AI 漫剧等多功能的新一代 AI 工作台应该具备哪些模块并给出从环境准备到跑通一个 AI 漫剧工作流的完整实操思路。文章会尽量贴近工程落地的角度帮助你理解每个功能模块为什么存在、彼此之间如何协作、实际配置时容易踩哪些坑。文章适合以下读者刚接触 ComfyUI、Agent、MCP想梳理技术脉络的新手。已经用 ComfyUI 出图想往工作流自动化方向进阶的开发者。正在做 AI 创作平台、AI 内容工具的产品经理和开发同学。1. DX-OS 是什么一个把创作链路装进同一块画布的工作台1.1 为什么叫“AI 操作系统”传统意义上的操作系统负责管理计算机的 CPU、内存、文件和外部设备为上层的应用软件提供统一运行环境。而 DX-OS 这里的“操作系统”并不是要替代 Windows 或 macOS它更像一个面向 AI 工作流的“创作操作系统”把各种生成模型、绘图引擎、外部工具和自动化代理统一管理起来。你可以把它理解成一层“胶水层”加上一个“可视化调度层”底层是各种能力引擎例如 ComfyUI、本地大模型、MCP Server。中间是 Skills也就是可复用的技能包。上层是 Agent负责理解用户的创作目标并调度这些技能和工具去执行。整个界面则通过无限画布的方式呈现让每个节点、每步产物都像一张卡片一样铺在画布上。这样的设计思路本质上是在解决一个核心矛盾AI 工具的能力越来越强但工具之间的协作成本也越来越高。1.2 DX-OS 解决的核心问题以前用一个 AI 漫剧类项目常常需要五六个软件来回切换用文本模型写故事大纲和分镜脚本。把分镜描述复制到 ComfyUI 中生成图片。把图片导入设计软件做分层、调整构图。再通过脚本把图片按顺序组装起来。最后还要记录每一步的用到的参数和模型方便后续调整。每一步都可以跑通但每一步之间的衔接都需要人工完成。DX-OS 这类产品试图把上面这个过程完整地“编排”起来无限画布用来组织流程节点让每个步骤的输入输出都可视化。图片分层把 ComfyUI 生成的结果转成可继续编辑的工程文件。Skills 封装确定性行为比如“把故事大纲转成镜头列表”。MCP 让 Agent 可以安全地访问文件系统、数据库、外部 API。Agent 负责把上述能力组合起来按目标自动执行。这样一套组合使得“从一句话到一组分镜图”成为可能并且每一步之间不再是断裂的。1.3 适合谁用从实际使用场景来看DX-OS 更适合以下几类人AI 绘画进阶用户已经用 ComfyUI 出图但觉得每次手动改工作流很麻烦希望把流程模板化。内容创作者需要批量生成漫画、漫剧、宣传图对效率和一致性有要求。前端/客户端开发者关注 AI 原生应用的交互设计例如无限画布、节点编辑器这类 UI。后端开发者想了解 Agent、Skill、MCP 如何在实际产品中协同工作。如果你是第一次接触这些概念也不要紧。下面先从核心功能模块逐个拆解。2. 核心功能全景从画布到漫剧的模块拆解2.1 无限画布降低 AI 创作流程的组织成本无限画布是 DX-OS 交互层的核心。传统的线性页面只适合展示单一内容但 AI 创作流程往往是非线性的一个分镜为了生成多张候选图需要跑多个工作流一张图可能要经过多轮迭代一条漫剧又由几十个分镜组成。这些内容放在线性列表里会非常混乱放到无限画布上则清晰得多。无限画布带来三个直接好处流程可视化。每个节点代表一个工作流、一段文本或一张图片节点之间的连线代表数据流向用户一眼就能看出整个项目推进到了哪一步。多方案并行。同一个分镜可以并排挂多组参数方便对比。素材组织。素材、提示词、模型信息都可以以卡片形式组织在画布中减少在文件夹里翻来找去的时间。对开发者来说无限画布的启发是不要把 AI 工作流设计成一串函数调用的黑盒而是把它设计成“可观察、可干预、可回退”的节点网络。2.2 图片分层把生成结果当成可继续编辑的工程文件普通 AI 绘画工具输出的是一张平面 PNG 或 JPG。这张图虽然好看但后期调整空间很小。比如背景要换、前景人物要移动、某个元素要单独调整平面图片都很麻烦。DX-OS 内置的图片分层能力解决的是“生成结果可编辑”的问题。它会把生成结果拆成多个图层每个图层对应画面中的一类元素例如背景层。人物层。前景装饰层。特效层。这种做法类似于 PSD 文件里的图层概念。有一点需要注意AI 模型原生输出并不一定带分层信息所以实际产品通常是靠“图层分割模型”或“分层渲染工作流”来得到分层结果。也就是说它更像一个后处理管线而不是生成模型本身就输出 PSD。对用户来说图片分层意味着生成结果并不是终点而是编辑的起点。在漫剧这样的项目中分层能力尤其重要因为同一个背景可以在多个分镜中复用只需更换人物层即可。2.3 AI 漫剧一个典型的多模态流水线AI 漫剧是 DX-OS 中一个相对完整的多模态场景。它不是一个单一功能而是一条流水线通常包含以下步骤故事大纲先用文本模型生成完整的故事框架。分镜脚本把故事拆成镜头级描述包含景别、运镜、画面内容、台词。角色一致性设定为每个角色生成稳定的外貌描述方便后续出图保持一致。场景生成使用 ComfyUI 生成每个镜头的画面。图片分层与后期对生成图片进行分层调整构图导出为可继续编辑的工程文件。组装按顺序组装分镜如果需要还可以接入配音和时间轴工具。这条流水线涉及文本模型、图像生成模型、图片编辑工具、自动化编排正好可以展示 DX-OS 各个模块是如何协作的。2.4 模块之间的关系用一张简单的描述来概括无限画布是“界面”。ComfyUI 是“图像生成引擎”。图片分层是“后期处理管线”。Skills 是“技能库”。MCP 是“外部连接器”。Agent 是“调度大脑”。后续章节会围绕这些模块逐一展开并给出可落地的配置思路。3. ComfyUI 集成与工作流3.1 ComfyUI 是什么为什么 DX-OS 会内置它ComfyUI 是一个基于节点式工作流的 Stable Diffusion 图像生成工具。用户把不同的功能节点比如“加载模型”“输入提示词”“采样器”“保存图片”用连线搭成流程图然后一键运行。它的优势非常明显灵活度高几乎每个环节都能控制。工作流可以导出为 JSON 文件方便分享和复用。支持批量和 API 方式调用适合二次开发。DX-OS 选择内置 ComfyUI原因也很直接它已经拥有庞大的工作流生态和用户基础。内置 ComfyUI 可以避免开发一套新的生成引擎同时又能利用社区沉淀的大量优秀工作流。如果你之前在找 ComfyUI 一键整合包、ComfyUI 安装教程那么可以把 DX-OS 理解成一种“更上一层”的封装它帮你把 ComfyUI 的模型、工作流和外部工具统一管理起来让你把注意力放在项目本身。3.2 解析一个最小工作流在 ComfyUI 中一个最基础的生成流程至少包含四类节点CheckpointLoader加载基础模型。CLIPTextEncode编码正向提示词和反向提示词。KSampler执行采样生成潜空间图像。VAEDecode 和 SaveImage解码并保存图片。这些节点组合成一个 JSON 工作流文件。DX-OS 中导入这种工作流的方式通常是把工作流 JSON 文件拖入画布。或者通过“导入工作流”按钮选择文件。一个值得新手注意的点ComfyUI 工作流 JSON 里可能包含 UI 布局信息不同版本之间可能不兼容。如果你导入报错优先检查 ComfyUI 核心版本和自定义节点版本是否匹配。3.3 模型管理思路ComfyUI 使用起来最麻烦的部分之一就是模型管理。常见的模型有Checkpoint 大模型例如 SD1.5、SDXL、社区微调模型。LoRA 模型用于调整风格或人物特征。VAE 模型影响画面色彩和细节。ControlNet 模型用于控制构图、姿势、线稿等。DX-OS 集成 ComfyUI 后通常会在设置中提供一个模型目录配置。需要你把模型文件放到指定目录并在界面上刷新。如果你发现某个工作流模型加载失败优先检查模型文件是否已经下载到正确目录。模型文件名是否包含空格或中文字符。工作流里配置的模型名称是否与本地模型名称完全一致。4. Skills 与 MCP给 AI 扩展能力的两种方式Skills 和 MCP 是 DX-OS 这类 AI 工作台里最容易混淆的两个概念。下面把这两个概念拆开讲清楚。4.1 Skills定义“会做什么”Skills 可以理解成一组结构化的“技能包”它告诉 Agent“当你遇到某类任务时可以按这个流程执行。”一个 Skill 通常包含描述文件说明这个技能的名称、适用场景、输入输出。指令内容详细描述执行步骤让 Agent 知道怎么一步步完成任务。可选资源例如脚本、模板、参考示例。简单来说Skills 是给 AI 的“SOP 手册”。你希望 AI 稳定地完成某项任务光靠提示词可能不够因为大模型每次输出都有随机性。而 Skills 通过固定的步骤约束让输出结果更稳定、更可预期。举个例子一个“AI 漫剧分镜脚本生成”技能可以这样描述--- name: comic-script-writer description: 根据故事大纲生成 AI 漫剧分镜脚本输出 JSON 格式的镜头列表。 --- 你是一个 AI 漫剧编剧。用户会输入故事大纲请按以下步骤完成 1. 将故事拆解为若干镜头每个镜头包含一个明确的画面事件。 2. 为每个镜头输出以下字段 - scene_id: 镜头序号 - camera: 景别远景/全景/中景/近景/特写 - prompt: 英文正向提示词描述画面主体、环境、光线、风格 - negative_prompt: 反向提示词 - duration: 建议时长秒 3. 确保人物外貌描述在多个镜头中保持一致。 4. 最终输出 JSON 数组不要附加大段解释。把这段内容保存为 SKILL.md 文件放到 skills 目录下DX-OS 中的 Agent 就能识别并调用这个技能。从热词里可以看到最近“find skills”“skills 推荐”这类搜索很多也出现了像 superpower skills、mattpocock skills 这类社区技能包。当你在使用社区 Skills 时一定要注意先检查技能内容是否包含危险命令。再确认技能使用的模型能力是否达标。最后在小规模任务上验证再用于正式项目。4.2 MCP定义“能连什么”MCP 全称是 Model Context Protocol模型上下文协议。它解决的是 AI 应用如何与外部系统交互的问题。如果说 Skills 是“会做什么”那 MCP 就是“能连什么”。通过 MCP ServerAgent 可以连接文件系统、数据库、浏览器、设计工具、API 服务等外部系统并且以统一的协议进行通信。在当前生态里MCP Server 的种类非常多常见的有文件系统 MCP让 Agent 读写本地文件。数据库 MCP让 Agent 执行 SQL 查询。浏览器 MCP让 Agent 控制浏览器进行页面操作。设计工具 MCP例如 Figma MCP、蓝湖 MCP让 Agent 读取设计稿信息。在 DX-OS 中配置 MCP Server通常是在配置文件里声明服务器地址和权限。下面是一个典型的 MCP 配置片段仅用于演示配置结构{ mcpServers: { filesystem: { command: npx, args: [ -y, modelcontextprotocol/server-filesystem, /data/workspace ] }, fetch: { command: npx, args: [ -y, modelcontextprotocol/server-fetch ] } } }需要特别注意的是具体 MCP Server 包的名称和参数会随版本迭代变化。实际使用前应查阅官方文档不要照抄上面这个示例就当生产配置。4.3 Agent Skill 和 MCP 有什么区别很多人在搜索“agent skill 和 mcp 有什么区别”这里用一个例子来区分假设你要让 AI 帮你做一份漫剧分镜 PPTAgent 是那个“项目经理”它理解你的目标并制定执行计划。Skill 是“工作手册”它规定写分镜的步骤和格式不涉及外部工具。MCP 是“连接器”它让 Agent 能读取你的图片素材文件夹、写入 PPT 文件。所以Skill 解决的是“任务怎么做”。MCP 解决的是“数据从哪里来、结果写到哪里去”。Agent 解决的是“先做什么、后做什么、遇到问题怎么处理”。5. Agent 编排从单个技能到完整流程5.1 什么是 AgentAgent 在这里指的是“智能体”它能够理解用户目标、拆解任务、调用工具、观察结果并根据结果决定下一步动作。一个简单的 Agent 工作流可以描述为接收用户输入的目标。将目标拆解为多个子任务。为每个子任务选择合适的 Skill 或 MCP 工具。执行并检查结果。如果结果不符合预期自动调整参数后重试。在 DX-OS 中Agent 通常以“流程编排”的形式存在。你可以把多个 Skills 串联起来中间用 MCP 连接外部数据最终得到一个可复用的自动化流水线。5.2 DX-OS 里的 Agent 常见工作模式从使用角度看DX-OS 的 Agent 大致有三种工作模式单轮任务型用户只提一次目标Agent 完成后返回结果适合“帮我根据这个大纲生成 5 张分镜图”这类任务。多轮迭代型Agent 执行一步、展示结果、等待用户确认再继续适合对质量要求较高的场景。批量流水线型Agent 按预置流程批量处理例如“把整本小说chapter 1 到 chapter 10 全部分镜并出图”。如果你刚开始接触 Agent 开发建议从“单轮任务型”开始把单一流程跑通后再叠加复杂度。5.3 Agent 项目的边界注意事项在“agent项目”和“agent开发”相关讨论中经常出现的问题是Agent 到底能自动到哪一步现实中的 Agent 并没有那么“无所不能”常见的坑有Agent 执行时间过长超过模型或服务的响应限制出现类似 “the agent execution provider did not respond in time” 的报错。Agent 在工具调用时因为参数格式问题反复重试。Agent 的中间结果不稳定需要手动干预。解决思路也很明确把大任务拆成小步骤每步设置超时机制。在关键节点给 Agent 提供明确的判断标准告诉它什么结果算通过。尽量减少不必要的工具调用能一次算完的不要分三次。6. 环境准备与基础配置6.1 运行环境检查DX-OS 这类大型工作台对硬件要求较高尤其是内置 ComfyUI 后生成图片依赖 GPU 计算。在开始之前需要确认以下环境操作系统Windows 10/11、macOS、Linux 均可但显卡驱动和 CUDA 环境需要提前装好。GPU推荐 NVIDIA 显卡显存建议至少 8GB显存越大越能流畅运行 SDXL 等大模型。Python 环境很多 AI 组件依赖 Python建议安装 3.10 或 3.11 版本。Node.js 环境部分 MCP Server 依赖 npx 运行建议安装 Node.js 18 以上版本。磁盘空间模型文件通常很大建议预留 30GB 以上空间。这里不写死具体版本号是因为不同版本迭代太快实际应以官方文档为准。核心思路是GPU 驱动、Python、Node.js 这三样先保证可用。6.2 安装与初始化由于 DX-OS 的具体安装方式会随版本更新本文不给出具体安装包路径。但从常规 AI 工作台的使用逻辑来看安装后通常需要经历以下步骤安装主程序并启动。指定数据目录用于保存画布项目、模型文件、工作流和生成结果。在设置中配置 ComfyUI 的模型路径。创建或导入一个项目。从模板或空白画布开始。完成这些步骤后你会得到一个可以自由拖拽节点的无限画布界面。6.3 配置用户目录与模型路径为了让 ComfyUI 能够找到模型需要在设置中指定模型目录。模型目录常见结构如下models/ checkpoints/ loras/ vae/ controlnet/如果你之前使用过秋叶整合包或手动安装过 ComfyUI可以把之前的模型目录直接挂载过来省去重新下载。不过要注意不同版本对模型目录的读取方式可能不同挂载后需要刷新模型列表并确认工作流中的模型名称能匹配上。7. 实战在 DX-OS 中跑通一个 AI 漫剧工作流这一节我们从零开始搭建一个最小可用的 AI 漫剧分镜工作流。目标很简单输入一个故事大纲输出 3 张连续的分镜画面。7.1 明确输入输出输入一段中文故事大纲例如“一个少年在雨夜发现了一座发光的古老钟楼他走进去后进入了另一个世界。”输出3 个分镜脚本每个分镜包含场景描述、正向提示词、反向提示词。3 张生成的图片保存在指定输出目录。7.2 把流程拆成 5 个阶段为了降低复杂度我们把整个流程拆成 5 个阶段编写分镜脚本使用文本模型把大纲拆成镜头。生成画面提示词将中文镜头描述翻译成适合图像模型的英文提示词。调用 ComfyUI 出图把提示词作为工作流参数输入。基础检查判断图片是否生成成功。汇总结果生成一个包含图片路径和分镜说明的汇总文件。7.3 配置 Skills首先创建一个分镜脚本技能文件路径建议放在skills/comic-script-writer/SKILL.md--- name: comic-script-writer description: 根据故事大纲生成 AI 漫剧分镜脚本输出 JSON 格式的镜头列表。 --- 你是一个专业的 AI 漫剧分镜师。用户会输入一个故事大纲你需要完成以下任务 1. 判断故事的关键转折点将故事拆成 3 个镜头。 2. 对每个镜头输出以下 JSON 字段 - scene_id: 镜头编号 - location: 场景地点 - action: 画面中的主要动作 - style: 画面风格 - prompt: 英文正向提示词用于图像生成 - negative_prompt: 英文反向提示词 3. 三个镜头之间应存在因果连续性人物外观保持一致。 输出格式要求只输出 JSON 数组不要输出其他文字。再创建一个提示词优化技能路径为skills/prompt-refiner/SKILL.md--- name: prompt-refiner description: 将中文分镜描述转换为高质量英文图像提示词。 --- 你是一个提示词工程专家。用户会输入一个分镜描述请将其转换为结构化的英文提示词。 规则 1. 提示词结构依次为主体、环境、光线、风格、画质关键词。 2. 使用英文输出关键词之间用逗号分隔。 3. 反向提示词包含常见画质问题如 lowres, bad anatomy, blurry 等。 4. 不改变用户原始创意。 输出格式JSON 对象包含 prompt 和 negative_prompt 两个字段。在实际使用时你只需要通过界面“加载技能”或把技能目录交给 Agent 即可。7.4 接入 MCP Server为了让 Agent 能把最终结果保存到指定目录我们需要接入一个文件系统 MCP Server。假设工作区目录是/data/workspace配置如下{ mcpServers: { filesystem: { command: npx, args: [ -y, modelcontextprotocol/server-filesystem, /data/workspace ] } } }注意如果你运行在 Windows 系统路径写法可能不同例如D:/workspace。同时不要给 MCP Server 暴露整个磁盘的权限只给需要访问的工作区目录即可这样可以降低安全风险。7.5 编排 Agent 流程接下来把上述 Skills 和 MCP Server 组合成一个 Agent 流程。这类流程在 DX-OS 中通常以项目配置的形式保存。下面是一个用于演示思路的 YAML 配置agent: name: ai-comic-producer description: 从故事大纲到 AI 漫剧分镜图的最小工作流 steps: - skill: comic-script-writer input: story_outline output: scene_script - skill: prompt-refiner input: scene_script output: refined_prompts - comfyui: workflow: workflows/static_scene.json input_mapping: prompt: refined_prompts[*].prompt negative_prompt: refined_prompts[*].negative_prompt output_dir: /data/workspace/output/images - verify: check: image_files_exist retry: 2 - mcp: filesystem action: write_summary args: output: /data/workspace/output/summary.json这份配置表达的核心逻辑是先用 comic-script-writer 生成分镜脚本。再用 prompt-refiner 优化提示词。然后调用 ComfyUI 工作流批量出图。接着检查图片是否生成成功失败则重试。最后通过 filesystem MCP 写入汇总文件。不同版本的 DX-OS 配置格式可能不同这里的重点是理解编排思路而不是死记字段。7.6 执行与结果检查配置完成后运行 Agent。理想情况下你会看到分镜脚本 JSON 生成。提示词优化完成。ComfyUI 日志显示 3 张图片生成成功。output 目录中出现 3 张图片和 1 个 summary.json。建议执行后检查以下几个点图片是否真的存在于指定目录。分镜之间的人物是否保持一致。提示词是否完整、没有被截断。反向提示词是否生效画面是否出现明显瑕疵。如果某个环节失败按照下一节的排查思路逐个定位。8. 常见问题与排查思路这里汇总了几个高频问题按实际经验整理成表格问题现象常见原因解决思路ComfyUI 模型加载失败模型路径未配置、模型名称不匹配检查设置中的模型目录刷新模型列表核对模型名称Skills 不生效目录结构错误、SKILL.md 格式不规范确认放在 skills 目录下检查 frontmatter 中的 name 和 descriptionMCP Server 连不上端口被占用、鉴权失败、依赖未安装查看 MCP 日志单独运行命令测试确认服务器地址和 tokenAgent 执行超时单个任务步骤太多、模型响应慢将任务拆小增加超时配置减少重试次数生成的图片分层丢失工作流中没有分层导出节点检查是否使用支持分层输出的后处理工作流Agent 输出的 JSON 格式错误提示词约束不足、模型能力不够在提示词中显式指定字段和格式增加示例如果你遇到 Agent 报错 “the agent execution provider did not respond in time”这个问题通常表示 Agent 在执行某个工具或模型调用时超时。排查顺序如下先确认是哪个步骤超时查看日志中的步骤名称。如果是 ComfyUI 出图慢检查 GPU 负载和队列是否堆积。如果是外部 API 调用超时检查网络连接和接口响应时间。适当调大超时时间或者把任务拆成更小的步骤。另外如果你在配置 Figma MCP 时发现工具注册不上例如社区里有人提到 “figma mcp 在 codex 中总是工具注册不上”通用的排查方向是确认 MCP Server 是否能独立启动。检查配置中的参数是否完整例如 API Token。检查客户端工具名是否和 MCP Server 注册的工具名一致。查看客户端日志看是否有工具注册失败的错误信息。9. 最佳实践与工程建议9.1 工作流命名与模块化无论是 ComfyUI 工作流、Skill 还是 Agent 流程命名都要清晰。建议采用“类型_场景_版本”的结构例如comfyui_动漫场景_v1.json skill_分镜脚本_v2 agent_漫剧生产_测试版同时尽量做到模块化。把“出图”和“后处理”拆成独立工作流方便复用。一个项目里不要把所有逻辑堆到一个巨大的流程里。9.2 素材与模型路径统一管理项目中的素材、模型、输出结果建议使用固定的目录结构项目根目录/ inputs/ # 输入素材 outputs/ # 生成结果 workflows/ # ComfyUI 工作流 skills/ # 技能包 logs/ # 运行日志统一路径管理的好处是Agent 在调用 MCP 读写文件时不容易越界出了问题也容易定位。9.3 Skills 的权限边界在配置 Skills 时一定要控制权限范围。尤其是社区下载的 Skills可能包含你并不了解的指令。使用前做到“三查”查描述文件是否包含下载、执行脚本、修改系统配置等敏感操作。查技能中引用的脚本是否来自可信来源。查技能执行是否会读写到非预期目录。建议把所有 Skills 默认放在沙箱目录中运行不要赋予系统级权限。9.4 MCP Server 最小权限MCP Server 的设计初衷是让 Agent 可以连接外部世界但连接范围越大风险也越大。生产环境中建议遵循最小权限原则文件系统 MCP 只开放项目工作区目录。数据库 MCP 只授权只读账号除非业务明确需要写入。不要长期保留高权限 Token用完即撤销。如果项目涉及敏感数据还要在 MCP Server 层做访问审计记录每次工具调用的时间、调用方、参数摘要。9.5 Agent 执行加审计日志Agent 自动执行时输出结果固然重要但运行过程也不能忽略。建议为 Agent 增加结构化日志至少包含步骤名称。开始时间和结束时间。输入参数摘要。输出结果摘要。错误信息。耗时。有了这些日志排查问题时就不再是“黑盒猜谜”。9.6 备份与版本管理在做 AI 工作流开发时版本管理同样重要。推荐做法把 ComfyUI 工作流、Skills 配置文件、Agent 流程配置都纳入 Git 管理。每次调整参数前记录旧版本的效果。对生成结果定期备份尤其是还在调优阶段的项目。这样即使某一版本迭代出了问题也可以快速回滚到可用状态。10. 总结与下一步学习路线这篇文章围绕 DX-OS 的定位和核心模块展开重点拆解了无限画布、图片分层、ComfyUI、Skills、MCP、Agent、AI 漫剧这几个概念之间的关系并通过一个 AI 漫剧工作流的例子演示了从分镜脚本到出图、再到结果汇总的完整思路。如果你之前对 ComfyUI 只停留在“下载模型、导入工作流出图”的阶段那么下一步可以尝试理解 ComfyUI 工作流中的关键节点学会读写 API 方式的工作流。自己编写一个简单的 Skill先跑通“输入大纲、输出分镜 JSON”这个小闭环。接入一个本地文件系统 MCP Server让 Agent 能自动保存结果。最后再把 ComfyUI 出图接入流程串成完整链路。在实际项目中优先关注三件事模型的路径和版本一致性、Skills 的权限边界、Agent 的超时和日志。这三件事做好了整个工作台的稳定性会明显提升。如果你正在使用或准备使用 DX-OS建议先从一个最小工作流开始不要一上来就想做完整漫剧。先把“一个镜头从文本到图片”跑通再逐步扩展成多个镜头、多个角色、批量处理。AI 系统再强大也需要一个可维护、可观测的工程化底座。