8GB 笔记本 39.3 tok/s、单卡跑 753B:FreeToken 把 frontier MoE 拉回本地 📅 发布时间:2026/8/25 1:23:47 👁 浏览次数: 8GB 笔记本 39.3 tok/s、单卡跑 753BFreeToken 把 frontier MoE 拉回本地Hugging Face 每日论文2026-08-20 精选「跑不动 frontier 模型」这六个字过去一年几乎成了本地 AI 的紧箍咒——能跑的开源模型一般不超过 70B模型一大就得排队用云。UC Berkeley、UT Austin、MIT 三校联合团队 8 月 17 日挂出 arXiv 编号 2608.16157 的论文 FreeToken第一次把这件事彻底反过来8GB 显存的笔记本能以 39.3 tok/s 跑 35B 级模型单张 RTX PRO 6000 工作站卡能跑通 753B 的 GLM-5.2连 RTX 4060 笔记本都能超过 RTX 4090 的 92% 速度。论文 8 月 20 日上线 Hugging Face 每日论文并被纳入 Trending社区 48 颗星把这条「本地重新跑赢云端」的路线彻底点亮了。为什么 frontier 模型过去必须跑在数据中心MoE混合专家模型是把上千亿参数「按需激活」的设计——DeepSeek-V4-Flash、Qwen3.6-35B-A3B、GLM-5.2 都是这一类。它们的特点是「总参数大、激活参数小」理论上 35B 激活量就能跑出 700B 级模型的质量。但「总参数大」这件事本身就是个工程噩梦模型权重得能常驻内存、被激活的那部分 expert 还得能从存储层流到 GPU 上算。普通笔记本 / 游戏台式机的显存装不下、带宽又不够于是 frontier 模型的推理自然就集中到了 H100 / H200 这类数据中心 GPU 上。过去几年业界做了三种尝试。第一种是 vLLM / SGLang 这一类数据中心优化框架但它们都假设 GPU 能装下整个模型本地硬件根本谈不上。第二种是 llama.cpp 走 CPU offloading把 expert 留在内存、让 CPU 算这条路在 35B 量级还行但 GLM-5.2 这种 753B 模型需要 753 GB 到 1.5 TB 的 host-resident expert 权重远超 512 GB 的物理内存上限根本不能跑。第三种是 KTransformers 这种稀疏激活专家库对小模型做得不错但碰到 GLM-5.2 的 NVFP4 量化布局CPU kernel 直接读不动。FreeToken 团队的判断很清晰所有这些方案的共同短板是把「GPU 太小装不下」当成了一个静态约束再想办法绕过他们的方案则把整台机器看作一个「弹性推理平台」让模型按运行时实际资源自己伸缩。设计核心把执行阶段、缓存、内存管理拆开再合上FreeToken 的工程实现由两个执行原则加一条弹性资源管理策略组成三个机制彼此独立又互相咬合。第一个原则是「带宽自适应执行」。Prefill 阶段用双缓冲GPU 在算当前层的 experts 时下一层的 experts 已经从 host 内存通过 PCIe streaming 过来了算完一步就把下一层的塞进显存。Decode 阶段细粒度更高因为 PCIe 传输和 CPU 直接算 expert 这两件事会争同一份 host 内存带宽。FreeToken 给出了一个叫 q* 的调度策略每一步根据机器实测的两条带宽数字PCIe 带宽和 host 内存带宽把 cache miss 在「GPU cache fill」和「CPU 直接算」之间分配匹配机器实际能跑得动的状态。第二个原则是「语义感知缓存」。LLM Agent 在多轮里会反复编辑上下文比如删掉一段 thinking、加一段 tool call、回头改 prompt 的某一行。FreeToken 抓住这些「语义边界」做检查点——prefill 阶段把 recurrent state 锚在这些边界上一旦 agent 改了 prompt只需要重新算新加的那一段之前的检查点不动。Decode 阶段更细一层相邻 token 经常会路由到重叠的 expertFreeToken 用一个全局 LRU 缓存把这种局部性吃满绝大多数 routed access 在 VRAM 里就命中了只剩下极少数 miss 走 q* 调度。第三个机制是「弹性 GPU expert 内存生命周期」。传统做法在启动时就把 GPU expert 缓存大小定死模型能跑多远从那一刻就锁死了。FreeToken 把这一步做成运行时动态可调在 scheduler 安全点引擎会根据当前剩余显存自动 resize 和重建 GPU expert 缓存整个过程不需要重启引擎、不需要重新加载 host-resident expert 池启动延迟也通过「提前把 expert 加载到最终 host 布局」压了下来。实测六款消费级硬件全面跑赢最强 baseline论文在五款消费级机器上加一款工作站卡上做了 W2 评测W2 是 FreeToken 提的一个端到端吞吐量指标对照对象包括 llama.cpp 这个事实标准的本地推理框架。对照设计很关键所有数字都是同等权重、同等量化格式下测的。硬件内存FreeToken 相对最强 baseline备注RTX 3090 桌面24GB1.3×baseline llama.cppRTX 4090 桌面24GB1.3×baseline llama.cppRTX 5090 服务器主机32GB1.9×服务器级多通道内存RTX 5090 消费级桌面32GB2.1×双通道 DDR5与上一行同样 GPU 硅RTX 4060 笔记本8GB PCIe×81.8×39.3 tok/sNVFP4 量化达到 RTX 4090 的 92% 速度RTX PRO 6000 单卡工作站48GB2.0×14.9 tok/sGLM-5.2 753Bllama.cpp 7.3 tok/sTTFT 7.5s vs 7.8s几个数字值得拎出来讲。第一RTX 4060 笔记本只靠 8GB 显存、PCIe ×8 这种「入门级配置」用 NVFP4 量化版本跑到了 39.3 tok/s相当于 RTX 4090 的 92% 速度。换句话说只要推理框架选对一台普通游戏笔记本就能享受到旗舰消费卡的九成体验。第二5090 服务器主机和 5090 消费级桌面用的是同一块 GPU 硅唯一区别是 host 内存通道数多通道 vs 双通道 DDR5。FreeToken 切到消费级桌面只掉 4% 速度llama.cpp 则掉了 20%——这就是「把 host 内存当一等公民来调度」和「只把 host 内存当 offload 缓冲」的差距。第三RTX PRO 6000 单卡跑 GLM-5.2 这种 753B 的 frontier 级 MoEFreeToken 跑出 14.9 tok/sllama.cpp 只有 7.3 tok/s2.0 倍首 token 时延TTFTFreeToken 是 7.5 秒llama.cpp 是 7.8 秒几乎相同。KTransformers 在同一台机器上根本无法 serve 这个模型——它的 expert 加载策略需要 753 GB 到 1.5 TB 的 host-resident 权重而 512 GB 物理内存根本不够它的 CPU kernel 也读不了 NVFP4 的 layout。换句话说过去想本地跑 GLM-5.2 这件事在 FreeToken 出现之前根本不存在工程解。DeepSeek-V4-Flash 与生态闭环把 frontier 拉回本地这件事做到了FreeToken 的代码已经覆盖 20 多个 MoE 模型对外提供 OpenAI 兼容的 API 接口意味着 Codex、Claude Code、OpenCode、OpenClaw、DeepSeek Harness 这类真实编码 agent 可以直接接上。DeepSeek-V4-Flash 是 README 里点名支持的模型之一——一款典型的稀疏激活 MoE总参数比激活参数大很多正好是 FreeToken 弹性调度最能发挥的场景。更深一层的变化在生态。过去 frontier 模型意味着「必须订阅 OpenAI/Anthropic/DeepSeek 的 API本地只能跑得起 7B/13B/70B」现在 FreeToken 把 35B 笔记本、284B 消费级桌面、753B 工作站单卡这条曲线打通了对应的能力覆盖到了从日常编码助手到本地深度研究的整条需求。配合 Anthropic / OpenAI 兼容 API原有的 agent 框架基本不需要改代码就能切换到 FreeToken 后端。局限不是「AI PC 革命」的全部答案论文自己点出了几条边界。第一FreeToken 性能依赖 NVFP4 / MXFP4 / FP8 这类低精度格式对权重精度敏感的应用比如某些需要精确数值的科研推理不一定适合。第二host-resident expert 池仍然占物理内存跑 753B 这种超大模型还是要 512 GB 量级的 host RAM普通家用机器还是只能玩到 35B / 70B 这一档。第三KTransformers 那条对部分科学计算和长上下文推理做了大量专门优化的路线FreeToken 并没有覆盖对这些场景两者是互补而非替代。另外要注意论文给出的所有数字都在 NVIDIA RTX 30/40/50 系列上测得对 AMD GPU 的支持没有公开数据本地想用 AMD 显卡跑 FreeToken 还需要等社区后续 PR。为什么这篇值得现在就读对 AI 爱好者来说FreeToken 是一份「本地可以放心跑 frontier 模型」的可行性证明——8GB 显存的笔记本都能跑到 RTX 4090 的九成速度这意味着普通游戏 PC / Mac Studio 这类设备的本地推理体验会被一次性抬高几个台阶。对研究者来说论文里关于「PCIe 带宽 vs host 内存带宽双约束下的最优分配」是 MoE 推理调度的一篇高质量工程参考尤其是 q* 策略那段把缓存置换和 CPU offloading 统一到了一个优化框架里值得细读 §3.2。对工业团队来说flashml.ai 已经放出 FreeToken 的桌面 GUI 和 CLI支持 Windows 和 Linux安装只需要一句uv pip install freetoken[accel]对落地私有化部署而言是一条低成本路线。