GLM-5预训练数据揭秘:28.5T tokens背后的Scaling之路

GLM-5预训练数据揭秘:28.5T tokens背后的Scaling之路 GLM-5预训练数据揭秘28.5T tokens背后的Scaling之路【免费下载链接】GLM-5GLM-5: From Vibe Coding to Agentic Engineering项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-5GLM-5 是一款面向复杂系统工程与长程智能体任务的开源旗舰大模型。相比前代 GLM-4.5它将预训练数据从 23T 扩展到 28.5T tokens参数规模从 355B激活 32B扩展到 744B激活 40B并集成了 DeepSeek 稀疏注意力DSA大幅降低部署成本。这篇文章带你完整看懂 GLM-5 预训练 Scaling 的每一步。一、参数与数据双升级GLM-5 的 Scaling 清单 Scaling规模化扩展依然是提升模型智能效率最可靠的途径之一。GLM-5 在这一代做了两件事把模型做大、把数据喂足。升级维度GLM-4.5GLM-5提升幅度总参数量355B744B109%MoE 激活参数32B40B25%预训练数据量23T tokens28.5T tokens24%稀疏注意力无集成 DSA部署成本大幅下降 小知识GLM-5 采用 MoE混合专家架构744B 是总专家规模每次推理只激活 40B 参数——相当于图书馆藏书 744 万册每次只翻阅 40 万册既保留了超大知识容量又控制了计算开销。更详细的升级说明见官方中文文档README_zh.md。二、为什么 28.5T tokens 的预训练数据如此重要对新手来说tokens 数可以简单理解为模型读完了多少文字数据规模决定知识下限28.5T tokens 意味着模型在预训练阶段阅读了远超任何人类穷尽一生的文本量覆盖代码、论文、网页、对话等多领域语料数据质量决定智能上限GLM-5 团队并不只是堆量而是围绕复杂系统工程、长程任务等高价值场景优化数据配比让 28.5T tokens 中的每一部分都花在刀刃上数据与参数协同 Scaling仅加数据不加参数或反之都会遇到瓶颈。GLM-5 把数据量提升 24% 的同时把参数量提升 109%两者乘积效应显著拉开了与上一代的能力差距。三、DSA 稀疏注意力长上下文的降本秘诀 大上下文能力一直是部署大模型最烧钱的部分。GLM-5 集成了DeepSeek 稀疏注意力DSA其核心思想是不再对每个 token 与全部历史上下文做全量计算而是只关注真正相关的部分在保持长上下文能力的同时大幅降低推理与部署成本。对普通用户而言这意味着同样的硬件能跑起更长的上下文同样的服务价格用户能获得更低的响应延迟。这也是开源旗舰模型走向可落地的关键一步。四、后训练补位异步 RL 基础设施让数据长出卓越能力预训练决定会不会强化学习RL决定有多强。但大规模 RL 训练效率低一直是行业难题。GLM-5 团队自研了异步 RL 基础设施 slime通过异步化设计大幅提升训练吞吐量与效率使更细粒度的后训练迭代成为可能。预训练 后训练双管齐下是 GLM-5 在推理、编程和智能体任务上全面超越 GLM-4.7 的根本原因。五、基准测试28.5T tokens 换来了多大的提升官方在 8 项主流基准上对 GLM-5 与前沿闭源模型进行了对比覆盖智能体Agentic、推理与编码三大方向几个值得新手记住的关键数字SWE-bench Verified真实软件工程能力73.8 →77.8超越 Claude Opus 4.5 之外的多数对比项Terminal-Bench 2.0真实终端任务41.0 →56.2开源阵营领先τ²-Bench智能体任务87.4 →89.7追平闭源第一梯队8 项基准全部领先前代 GLM-4.7验证了数据 参数双重 Scaling 路线的有效性。六、真实世界场景从编码到长周期经营 在内部评估套件 CC-Bench-V2 上GLM-5 面向真实工程场景的表现同样亮眼前端构建成功率 98.0%26%、大仓库探索 65.6%、多步骤链式任务 52.3%多项指标反超对比模型更具想象力的是长周期经营能力。在 Vending Bench 2模拟运营一家自动售货机生意一整年中GLM-5 最终账户余额达$4,432在开源模型中排名第一展现出出色的长期规划与资源管理能力七、如何上手体验 GLM-5️获取模型GLM-5 提供 BF16 与 FP8 两种精度版本744B-A40B可通过主流模型社区下载详见 README.md 中的模型下载说明本地部署GLM-5 系列已适配 SGLang、vLLM、Transformers、KTransformers、Unsloth 等主流推理框架昇腾 NPU 平台部署参考 example/ascend.md思考力度调节通过reasoning_effort参数可在max与high两档之间切换默认max也可用enable_thinkingfalse完全关闭思考灵活平衡效果与速度进阶微调支持使用 slime、ms-swift 等框架进行 SFT / PPO / GRPO 微调把 GLM-5 变成垂直领域的专属模型生态技能项目内置的 skills/glm-master-skill/SKILL.md 汇总了 GLM 生态的官方技能目录与安装方法适合想扩展 OCR、图像生成等能力的用户。结语GLM-5 的故事是 Scaling 路线的一次教科书式实践28.5T tokens 的预训练数据打底、744B 参数规模承接、DSA 稀疏注意力降本、异步 RL 后训练封顶。正是这四层叠加让这款开源模型在推理、编码与长程智能体任务上全面逼近闭源前沿——也为所有想理解大模型是怎么变强的的用户提供了一条清晰可追溯的进阶之路。【免费下载链接】GLM-5GLM-5: From Vibe Coding to Agentic Engineering项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-5创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考