dots3-note Transformers 本地推理指南:单机快速跑通最小示例 📅 发布时间:2026/8/18 18:09:54 👁 浏览次数: dots3-note Transformers 本地推理指南单机快速跑通最小示例【免费下载链接】dots3-note-prev项目地址: https://ai.gitcode.com/hf_mirrors/dots-studio/dots3-note-prevdots3-note 是 dots 工作室推出的多模态 MoE混合专家大模型总参数 280B、激活参数仅 16B支持最长 512K 上下文可理解文本、图像、视频和音频。本文是一份面向新手的dots3-note 本地推理指南手把手带你用Transformers在单机环境快速跑通最小示例几分钟内完成模型加载与对话生成全程无需编写复杂代码。dots3-note 本地推理 MoE 多模态模型仓库dots3-note 是什么为什么适合本地推理dots3-note preview 是 dots3 系列中最轻量级的成员官方定位是能力、时延与推理成本的平衡点。它采用 256 个路由专家 1 个共享专家、Top-8 激活的稀疏结构虽然总参数量高达 280B但每次推理只激活 16B 参数显存占用远低于同规模稠密模型这正是它能单机部署的关键。它针对通用知识、数学推理、工具调用、代码生成、多模态理解等任务做了专门优化模型权重与建模代码采用 Apache 2.0 协议开源本地使用无后顾之忧。完整模型介绍可查看仓库根目录的README.md与README_CN.md详细的网络结构定义见config.json。单机推理前需要准备什么在动手前先确认三件事硬件推荐单机 8 卡 NVIDIA 节点如 H100建议加载 FP8 量化版权重BF16 需要更多显存显存有限时请调低上下文长度。驱动与基础库安装 NVIDIA 驱动支持的 PyTorch 与 torchvision如需处理音频和视频还要安装torchcodec并通过系统包管理器安装 FFmpeg。代码版本Transformers 对 dots3-note 的原生支持PR #47844目前仍在合入中请按下文指定版本安装。最快的安装方法一条命令装齐依赖打开终端执行下面这条命令即可完成全部依赖安装注意transformers使用了包含 dots3-note 支持的最新 PR 版本pip install accelerate pillow torchcodec kernels0.16.0 transformers githttps://github.com/huggingface/transformers.gitrefs/pull/47844/head如果你需要通过 git 克隆本仓库查看权重文件与配置仓库地址为https://gitcode.com/hf_mirrors/dots-studio/dots3-note-prev。模型权重会随from_pretrained自动下载无需手动搬运。跑通最小推理示例只需 8 行核心代码创建infer.py粘贴以下代码并运行。我们加载 FP8 量化版模型dots-studio/dots3-note-prev-fp8用 128 个 token 让模型做一个简单的自我介绍from transformers import AutoModelForMultimodalLM, AutoProcessor model_id dots-studio/dots3-note-prev-fp8 processor AutoProcessor.from_pretrained(model_id) model AutoModelForMultimodalLM.from_pretrained(model_id, dtypeauto, device_mapauto) messages [{role: user, content: 你好请简单介绍一下你自己。}] inputs processor.tokenizer.apply_chat_template( messages, add_generation_promptTrue, return_tensorspt, return_dictTrue, enable_thinkingFalse, ).to(model.device) outputs model.generate(**inputs, max_new_tokens128) print(processor.decode(outputs[0, inputs.input_ids.shape[1]:], skip_special_tokensTrue))运行python infer.py稍等片刻即可看到模型生成的回复。这段代码的核心逻辑只有三步加载处理器与模型 → 用聊天模板编码输入 → 生成并解码输出理解这三步之后你就能自由改造对话内容了。关键参数说明enable_thinking 是什么enable_thinkingFalse会让模型直接回复、不输出推理过程适合快速验证改为True时模型会先展示思考链适合数学题和逻辑推理类任务。该开关最终由仓库中的chat_template.jinja模板控制在模板第 76-78 行可以看到对应的处理逻辑感兴趣可以自行阅读源码学习。从文本扩展到图像、音频、视频dots3-note 是多模态模型只需把messages中的content从纯文本替换为多模态消息数组即可例如传入图片 URL 并提问这张图片中有几只猫。视频输入包含音轨时模型会同时理解画面与声音音频则支持转写与理解任务。多模态请求的完整示例同样收录在README.md的快速开始章节。本地推理常见问题与排查思路显存不足报错优先使用 FP8 版权重或通过环境变量调低上下文长度BF16 版请确保显存充足。transformers 版本过旧dot3s-note 依赖新特性务必使用 PR #47844 对应版本不要直接pip install transformers装最新稳定版。多模态输入报错确认已安装torchcodec与 FFmpeg二者缺失会导致图片/音频/视频预处理失败。想要更高的吞吐单机多卡场景推荐改用 SGLang 或 vLLM 提供 OpenAI 兼容 API 服务部署参数示例同样在README.md中。小结你的第一步本地推理已经完成通过本文的 dots3-note 本地推理指南你已经完成了单机环境下的最小示例跑通一条命令装好依赖、8 行代码完成对话生成。接下来可以尝试多模态输入、开启思考模式或切换 SGLang/vLLM 做服务化部署逐步探索这个 280B 参数多模态大模型的完整能力。【免费下载链接】dots3-note-prev项目地址: https://ai.gitcode.com/hf_mirrors/dots-studio/dots3-note-prev创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考