llamafile 预构建模型清单(Pre-built llamafiles)完全指南:从官方模型包到单文件零安装运行

llamafile 预构建模型清单(Pre-built llamafiles)完全指南:从官方模型包到单文件零安装运行 llamafile 预构建模型清单Pre-built llamafiles完全指南从官方模型包到单文件零安装运行【免费下载链接】llamafileDistribute and run LLMs with a single file.项目地址: https://gitcode.com/GitHub_Trending/ll/llamafile本文以 llamafile 官方文档中的预构建模型清单docs/pre-built-llamafiles.md为核心系统梳理随最新服务器版本v0.10.*与经典版本0.9.*一并发布的全部预构建 llamafile并给出跨平台macOS / Linux / BSD / Windows的下载、授权与运行步骤以及 Windows 4GB 可执行文件上限的绕过方案。读完本文你将能够依据硬件条件与模型量化级别Q8_0、Q5_K_S、Q4_K_M、BF16、mxfp4 等快速挑选合适的单文件模型并立刻在本机跑起来。一、什么是预构建 llamafilellamafile 是 Mozilla Builders 发起、现由 Mozilla.ai 维护的开源项目其核心理念是用一个单一可执行文件分发并运行 LLM模型权重、运行所需的一切依赖llama.cpp 推理引擎 Cosmopolitan Libc 实现的跨平台运行层以及默认启动参数被打包进同一个文件用户拿到后无需安装、无需配置即可本地运行详见 docs/index.md。预构建pre-builtllamafile指的是项目方预先制作好、权重已内置的模型包。从文件格式看一个 llamafile 本质上是基于 APEActually Portable Executable格式、以 ZIP 作为附加数据容器的自包含可执行文件——这正是 docs/creating_llamafiles.md 中描述的结构可执行程序 模型权重 .args默认参数。拿到任意一个预构建 llamafile 后你甚至可以直接用unzip -vl 文件名.llamafile检查它内部打包的内容Windows 上把它改名为.zip后可用图形界面的压缩工具打开。预构建 llamafile 的另一大价值是可复现性量化后的权重与对应版本的 llamafile 软件被前缀拼接在一起意味着发布时的行为可以被长期复现。每个预构建包都会标明它捆绑的服务器版本0.9.* 或 0.10.*用户始终知道自己下载的是哪个版本的软件。当前仓库源码 llamafile/version.h 显示本项目处于0.10.5LLAMAFILE_MAJOR0, LLAMAFILE_MINOR10, LLAMAFILE_PATCH5与本文第一张表所述最新版服务器 v0.10.*一致。二、最新版预构建 llamafile随 v0.10.* 服务器发布以下表格列出随最新可用版本服务器v0.10.*捆绑发布的所有预构建 llamafile。选择原则正如官方文档所强调文件越小越容易在无 GPU 的机器上流畅运行——作为参考基准Qwen3.5 0.8B Q8 量化包在树莓派 5Raspberry Pi 5上纯 CPU 推理可达约8 tokens/sec。模型大小许可证llamafile 文件名Qwen3.5 0.8B Q8_01.6 GBApache 2.0Qwen3.5-0.8B-Q8_0.llamafileQwen3.5 2B Q8_03.2 GBApache 2.0Qwen3.5-2B-Q8_0.llamafileMinistral 3 3B Instruct 2512 Q4_K_M3.4 GBApache 2.0Ministral-3-3B-Instruct-2512-Q4_K_M.llamafileQwen3.5 4B Q5_K_S4.1 GBApache 2.0Qwen3.5-4B-Q5_K_S.llamafilellava v1.6 mistral 7b Q4_K_M5.3 GBApache 2.0llava-v1.6-mistral-7b-Q4_K_M.llamafileApertus 8B Instruct 25095.9 GBApache 2.0Apertus-8B-Instruct-2509.llamafileQwen3.5 9B Q5_K_S7.4 GBApache 2.0Qwen3.5-9B-Q5_K_S.llamafileMinistral 3 3B Instruct 2512 BF167.8 GBApache 2.0Ministral-3-3B-Instruct-2512-BF16.llamafilellava v1.6 mistral 7b Q8_08.4 GBApache 2.0llava-v1.6-mistral-7b-Q8_0.llamafilegpt-oss 20b mxfp412 GBApache 2.0gpt-oss-20b-mxfp4.llamafilegpt-oss 20b Q5_K_S12 GBApache 2.0gpt-oss-20b-Q5_K_S.llamafileLFM2 24B A2B Q5_K_M16 GBlfm1.0LFM2-24B-A2B-Q5_K_M.llamafileQwen3.5 27B Q5_K_S19 GBApache 2.0Qwen3.5-27B-Q5_K_S.llamafile2.1 如何解读这张表量化级别文件名中的Q8_0、Q5_K_S、Q4_K_M、BF16、mxfp4直接决定文件大小、内存占用与生成质量BF16/F16精度最高、体积最大Q8_0、Q5_K_S、Q4_K_M依次在体积与质量之间取平衡mxfp4是面向 gpt-oss 20B 这类超大模型的 4-bit 量级。挑选时可参考 docs/cli_arguments.md 中-ngl, --gpu-layers等参数来决定是否/如何卸载到 GPU。多模态模型llava v1.6 mistral 7b与 Qwen3.5 系列支持图像输入可通过--image参数传入图片路径做图文问答适合需要视觉理解能力的场景gpt-oss 20b与Apertus 8B Instruct则适合作为 agent / 服务端推理底座docs/running_llamafile.md 中专门演示了如何用--server --jinja --ctx-size 64000将其架设为 agent 可调用的服务。嵌入模型本表末行之后见下文 Legacy 清单还包含E5-Mistral-7B-Instruct、mxbai-embed-large-v1等文本嵌入模型可配合--embedding/--embeddings服务端参数做向量化见 docs/cli_arguments.md 的 Server-Only Flags。2.2 下载方式这些 llamafile 托管在 Hugging Face 的mozilla-ai/llamafile_0.10仓库中该仓库同时存放llamafile、llamafile-thin、whisperfile、transcribefile、diffusionfile等独立单文件程序详见 docs/quickstart.md 中Which release file do I download一节。下载模板如下# 将 仓库下载根地址 替换为 mozilla-ai/llamafile_0.10 仓库对应的 resolve 下载根路径 curl -LO 仓库下载根地址/Qwen3.5-0.8B-Q8_0.llamafile仓库根目录 README.md 的 Quick Start 一节提供了完全相同的三件套流程下载 → 授权 → 运行可作为对照参考。三、Legacy llamafiles随 0.9.* 经典版服务器发布如果你更偏爱此前版本0.9.*的经典 llamafile 体验官方同时保留了旧服务器可执行文件捆绑的模型清单模型大小许可证llamafile 文件名LLaMA 3.2 1B Instruct1.11 GBLLaMA 3.2Llama-3.2-1B-Instruct-Q6_K.llamafileLLaMA 3.2 3B Instruct2.62 GBLLaMA 3.2Llama-3.2-3B-Instruct.Q6_K.llamafileLLaMA 3.1 8B Instruct5.23 GBLLaMA 3.1Llama-3.1-8B-Instruct.Q4_K_M.llamafileGemma 3 1B Instruct1.32 GBGemma 3gemma-3-1b-it.Q6_K.llamafileGemma 3 4B Instruct3.50 GBGemma 3gemma-3-4b-it.Q6_K.llamafileGemma 3 12B Instruct7.61 GBGemma 3gemma-3-12b-it.Q4_K_M.llamafileQwQ 32B7.61 GBApache 2.0Qwen_QwQ-32B-Q4_K_M.llamafileR1 Distill Qwen 14B9.30 GBMITDeepSeek-R1-Distill-Qwen-14B-Q4_K_M.llamafileR1 Distill Llama 8B5.23 GBMITDeepSeek-R1-Distill-Llama-8B-Q4_K_M.llamafileLLaVA 1.53.97 GBLLaMA 2llava-v1.5-7b-q4.llamafileMistral-7B-Instruct v0.34.42 GBApache 2.0mistral-7b-instruct-v0.3.Q4_0.llamafileGranite 3.2 8B Instruct5.25 GBApache 2.0granite-3.2-8b-instruct-Q4_K_M.llamafilePhi-3-mini-4k-instruct7.67 GBApache 2.0Phi-3-mini-4k-instruct.F16.llamafileMixtral-8x7B-Instruct30.03 GBApache 2.0mixtral-8x7b-instruct-v0.1.Q5_K_M.llamafileOLMo-7B5.68 GBApache 2.0OLMo-7B-0424.Q6_K.llamafile文本嵌入模型Text Embedding ModelsE5-Mistral-7B-Instruct5.16 GBMITe5-mistral-7b-instruct-Q5_K_M.llamafilemxbai-embed-large-v10.7 GBApache 2.0mxbai-embed-large-v1-f16.llamafile这些经典包的下载同样来自各模型对应的Mozilla/xxx-llamafile系列仓库每个模型还提供其他量化档位other quants可按需选择体积/精度更合适的版本。3.1 为什么会有两代清单正如 docs/index.md 所述llamafile 自 0.10.0 起采用了新的构建系统目的是让代码更容易与最新版 llama.cpp 保持对齐因此能支持更新的模型与功能但部分老功能可能暂缺。如果你更喜欢旧版体验随时可从 releases 页面获取旧版本而预构建 llamafile 上始终标注其捆绑的服务器版本下载前即可确认。两个清单并存正是为了同时覆盖追新与求稳两类用户。四、首次运行三分钟上手按照 docs/quickstart.md 的完整流程拿到预构建 llamafile 后只需三步4.1 macOS / Linux / BSD授权可执行权限chmod x Qwen3.5-0.8B-Q8_0.llamafile ./Qwen3.5-0.8B-Q8_0.llamafilechmod x只需执行一次。运行后一个终端聊天界面TUI会直接打开即可开始输入输入/upload加图片路径可上传图像多模态模型输入/help可查看全部可用命令Control-C结束进程。4.2 Windows重命名加 .exe并注意 4GB 上限Windows 用户需要把文件重命名、末尾加上.exe再运行。但官方文档明确警示Windows 对可执行文件存在 4GB 的大小上限而上述绝大多数预构建 llamafile 都超过这个限制因此无法直接在 Windows 上运行——唯一的例外是 LLaVA llamafile它比 4GB 限制小约 30MB可以运行。解决办法是llamafile 支持使用外部权重# 下载不带权重的 llamafile 可执行文件与独立的 GGUF 权重示例为 gpt-oss12GB curl -L -o llamafile.exe 仓库下载根地址/llamafile_0.10.1 curl -L -o gpt-oss.gguf 权重下载地址/gpt-oss-20b-Q5_K_S.gguf ./llamafile.exe -m gpt-oss.ggufWindows 上也可写作.\llamafile.exe -m gpt-oss.gguf。这条可执行文件 外部 GGUF 权重的路线也是官方在 docs/quickstart.md 中推荐的 Windows 通用方案并且任何平台都适用你完全可以用无权重版 llamafile 搭配手头任何 GGUF 权重包括 LM Studio、Ollama 等第三方应用已下载到本地的模型来运行。4.3 运行模式一个文件四种玩法预构建 llamafile 内建四种运行方式详见 docs/running_llamafile.md通过包装参数切换底层透传 llama.cpp 的全部参数参考 docs/cli_arguments.md模式参数用途示例单次问答CLI--cli -p ..../Apertus-8B-Instruct-2509.llamafile --cli -p Write a story about llamas终端聊天Chat--chat交互式多轮对话/help查看命令HTTP 服务Server--server --host 0.0.0.0 --port 8081启动 OpenAI 兼容 API 与 Web UI供其他程序/前端调用组合模式Combined默认不指定以上任一参数同时启动终端聊天与http://localhost:8080服务以服务器模式运行后除了浏览器访问http://localhost:8080/使用 llama.cpp 的 Web UI 之外还会暴露与OpenAI API、Anthropic Messages API兼容的 JSON 端点/v1/chat/completions等可直接用curl或 Python 的openai客户端包接入完整示例与返回 JSON 见 docs/quickstart.md 的 JSON API Quickstart 一节。多模态模型还能这样用./Ministral-3-3B-Instruct-2512-Q4_K_M.llamafile -ngl 9999 \ --cli \ --image ~/Pictures/lemurs.jpg \ -p Describe this picture4.4 GPU 加速速查预构建 llamafile 已内置 Apple MetalmacOS ARM64默认启用、NVIDIA CUDA、AMD ROCm 与 Vulkan 支持NVIDIA/AMD 用户传-ngl 999或--gpu-layers 999即可最大化 GPU 卸载可用--gpu nvidia/--gpu amd/--gpu vulkan强制指定后端以便诊断详见 docs/support.md 的 GPU 章节与 docs/cli_arguments.md 的--gpu MODE别名表。需要注意v0.10.* 系列的 CUDA 库为体积优化版IQ 量化IQ1_*~IQ4_*层在 NVIDIA GPU 上会自动留在 CPU 计算其他量化类型不受影响。五、关于模型清单的官方立场官方在文档末尾明确声明见 docs/pre-built-llamafiles.md 的 A note about models上述预构建 llamafile 不应被解读为 Mozilla 对特定模型、许可证或数据集的背书或推荐。清单的价值在于开箱即用而具体选型模型能力、量化档位、许可证合规性仍应由使用者根据自身需求独立判断。六、遇到问题怎么办官方为预构建 llamafile 的常见坑位准备了专门的排查页 docs/troubleshooting.md重点包括进程被立即杀掉检查是否安装了 CrowdStrike如有则申请将其加入白名单。macOSApple Silicon需安装 Xcode Command Line Tools 以完成自举若 zsh 下运行异常可尝试sh -c ./llamafilezsh 5.9 已修复该 bug出现无法验证开发者提示时可在系统设置 → 隐私与安全性中手动允许或使用sudo spctl --master-disable; 启动命令; sudo spctl --master-enable。Linux若报run-detectors或 WINE 相关错误通常是binfmt_misc注册缺失需为 APE 格式补充注册安装ape加载器并写入两条 register 规则命令见 docs/troubleshooting.md。Windows / WSL.exe重命名、4GB 上限改用外部权重WSL 下可注册 APE binfmt 服务/etc/systemd/system/cosmo-binfmt.service或禁用 WIN32 interop 解决大部分问题。七、延伸阅读快速上手全流程与 OpenAI 兼容 API 调用docs/quickstart.md四种运行模式与内置工具--tools alldocs/running_llamafile.md自行制作 llamafilezipalign 打包权重与.argsdocs/creating_llamafiles.md全部包装参数与透传的 llama.cpp 参数docs/cli_arguments.md支持的操作系统、CPU 与 GPU 后端矩阵docs/support.md总而言之预构建 llamafile 的价值在于下载即运行官方已经把最繁琐的环境适配工作做进了单一可执行文件里你要做的只是对照上文两张清单选一个体积与精度合适的模型按平台完成一次性的权限处理然后就能在终端或浏览器里开始对话了。【免费下载链接】llamafileDistribute and run LLMs with a single file.项目地址: https://gitcode.com/GitHub_Trending/ll/llamafile创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考