llama-models 上手指南:从许可邮件到第一条 Llama 回复,只需 5 条命令

llama-models 上手指南:从许可邮件到第一条 Llama 回复,只需 5 条命令 llama-models 上手指南从许可邮件到第一条 Llama 回复只需 5 条命令【免费下载链接】llama-modelsUtilities intended for use with Llama models.项目地址: https://gitcode.com/GitHub_Trending/ll/llama-modelsllama-models 是 Meta 官方维护的 Llama 模型工具仓库里面有从 Llama 2 到 Llama 4 各代的推理参考实现、llama-model命令行工具和 FP8/Int4 量化方案。目标只有一个拿到权重后尽快看到第一条模型回复。它到底能帮你解决什么先说三件很具体的事你可以对号入座想在本地机器上跑通 Llama 4 做一次对话验证。仓库自带示例脚本指定 checkpoint 目录加一条命令就能流式打印回复不用自己搭服务框架。要给自己团队搭一台低成本推理机。给推理命令加一个--quantization-mode参数GPU 需求能从 4 张卡直接降到 1~2 张显存预算当场省一半以上。做图像相关的应用。Llama 3.2-Vision 和 Llama 4 原生支持图像输入对话消息里直接混入图片字节即可。 五分钟跑起来从许可邮件到第一条回复整体流程不复杂接受许可、装环境、下权重、跑脚本。最小可运行的命令就这几条克隆需要的话仓库地址是 https://gitcode.com/GitHub_Trending/ll/llama-models git clone https://gitcode.com/GitHub_Trending/ll/llama-models cd llama-models pip install .[torch] llama-model list llama-model download --source meta --model-id Llama-4-Scout-17B-16E-Instruct下载会提示粘贴许可邮件里那个签名链接。跑推理的完整脚本长这样NGPUS4 CHECKPOINT_DIR~/.llama/checkpoints/Llama-4-Scout-17B-16E-Instruct PYTHONPATH$(git rev-parse --show-toplevel) \ torchrun --nproc_per_node$NGPUS \ -m models.llama4.scripts.chat_completion $CHECKPOINT_DIR \ --world_size $NGPUS脚本在 models/llama4/scripts/ 和 models/llama3/scripts/ 下其余参数温度、上下文长度等都有默认值第一次跑可以原样照抄。两个高频坑下载链接 24 小时过期也限下载次数。中途报403: Forbidden就是链接失效回邮件重新取一个即可不用重装任何东西。Llama 4 Scout 全精度bf16推理至少要 4 张 GPU。卡不够就先加--quantization-mode int4_mixed单张 80G 的卡就能跑后面单独讲这笔账。 核心能力拆解MoE、视觉、量化和长上下文MoE 路由如何撑起总参数Llama 4 的命名先看懂Scout-17B-16E 里的 17B 是每个 token 实际激活的参数量16E 表示总共有 16 个专家。每个 token 由路由器挑出 top_k 个专家默认 1 个其余专家这一步完全不参与计算所以总参数可以堆到几百 B而单次前向的算力开销仍接近一个 17B 的稠密模型。参数配置 里的moe_args管这件事top_k决定激活几个专家interleave_moe_layer_step决定哪些层走稀疏路由、哪些层保留稠密前馈网络。视觉信号怎么进入文本模型Llama 4 的多模态做法很克制图像先由独立的视觉编码器转成图像 token文本主干每隔几层插入一层交叉注意力层让文本隐状态去查询图像 token。好处是文本部分的计算图跟纯文本时几乎一致视觉能力是外挂进去的代价也小——视觉编码器 和 位置编码 各管一段互不耦合。量化部署的显存账怎么算README 里给了 Scout 的硬指标bf16 全精度 4 张 80G 卡FP8 混精 2 张Int4 混精 1 张。切换方式就是加一个参数--quantization-mode fp8_mixed --quantization-mode int4_mixedInt4 方案对应的是 int4 权重加 int8 动态激活的分组量化实现入口在 量化加载器它只量化 MoE 专家权重并刻意跳过首尾层保两头质量、压中间大头。10M 上下文是怎么来的Scout 标称 10M token 上下文靠三个配合RoPE 频率缩放把位置编码的可用范围拉长配置项在 args.py 里一眼能看到注意力温度在线调温attn_temperature_tuning处理超长序列下注意力分布变平的问题再加上 MoE 本身——计算量只跟激活参数成正比上下文再长也不要把整张专家的表拉满。工具调用解析在哪一层Llama 3.1 的工具调用解析独立放在 llama3/tool_utils.py负责从模型输出里识别工具调用、解析 JSON 并做合法性校验与对话模板配合使用models/llama3/tests/api/ 里有对应行为测试。想验证自己的 prompt 是否触发了合法调用可以直接跑这套用例。各版本能力对照版本参数形态上下文窗口分词器定位Llama 27B / 13B / 70B4KSentencepiece基线模型Llama 38B / 70B8K自研TikToken 系通用对话Llama 3.18B / 70B / 405B128K同上长上下文Llama 3.21B / 3B视觉版 11B / 90B128K同上轻量与多模态Llama 3.370B128K同上单尺寸通用Llama 4Scout 16 专家 / Maverick 128 专家激活 17B1M / 10M同上MoE 多模态各版本的使用政策和模型卡分别在 models/llama2/、models/llama3/、models/llama3_1/、models/llama3_2/、models/llama3_3/、models/llama4/ 目录下。选型时先定上下文长度和显存预算再回这张表选版本。⚖️ 和 Hugging Face 版、llama.cpp 的路线差异同一批权重社区里有三条常见使用路线拿它们对照维度本仓库原生 PyTorch 参考实现Hugging Face transformers 版llama.cpp 路线显存与并行bf16 / FP8 / Int4 三档torchrun 多卡张量并行依赖设备放置策略量化档位较少单卡甚至 CPU 也能跑上下文上限标称 1M~10M受实现与显存限制中小尺寸为主多模态交叉注意力层原生图像输入支持视觉版支持有限适用人群要多卡并行与 MoE 参考实现要生态、训练后处理一条龙要 CPU / 边端部署三者的权重是互通的用本仓库 CLI 下的原版权重可以转成 GGUF 给 llama.cpp 用。许可证统一为 Llama Community License商用前按 使用政策 核对一遍月度调用量的条款即可。 动手试试三个十分钟小练习跑仓库自带多模态对话chat_completion 脚本 默认会把 models/resources/pasta.jpeg 和一张狗图喂给模型让它写一句把两张图串起来的俳句。预期效果checkpoint 路径换成自己下载的权重目录就能亲眼看到模型怎么处理两张图加一句指令的混合输入。给推理命令追加量化参数把--quantization-mode int4_mixed加到 torchrun 命令末尾NGPUS从 4 改 1。预期效果Scout 从 4 张 80G 卡压到 1 张回复质量和默认模式肉眼难辨。换 Base 模型做补全把脚本名从models.llama4.scripts.chat_completion换成models.llama4.scripts.completioncheckpoint 指到 Base 版本。预期效果对话模板自动退化成纯补全参数一个都不用动。从下载权重到改一个参数跑起来Llama 4 在这几条路线里门槛确实不高剩下的事就是按自己的场景选参数了。【免费下载链接】llama-modelsUtilities intended for use with Llama models.项目地址: https://gitcode.com/GitHub_Trending/ll/llama-models创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考