LiteRT-LM把 Gemma 装进手机、笔记本和树莓派的跨平台 LLM 推理库【免费下载链接】LiteRT-LMLiteRT-LM is Googles production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.项目地址: https://gitcode.com/GitHub_Trending/li/LiteRT-LMLiteRT-LM 是 Google 开源的跨平台语言模型运行库面向边缘 LLM 推理场景它把大模型拆成多组件管道在 Android、iOS、Web、桌面乃至树莓派上本地跑起来。不用服务器、不用云 API下载量化后的模型文件就能开始推理。为什么端侧推理需要专门的运行库调云端 API你要面对网络延迟、数据离开设备、按 token 计费三件事。但真正的难点不在把模型跑起来——一个模型早已不是一坨权重而是一条流水线分词器、提示词模板、KV 缓存管理、采样多模态还要接视觉和音频前处理。自己手搓意味着几千行胶水代码外加每个平台的硬件差异都要自己追。LiteRT-LM 就是架在 LiteRTGoogle 的轻量模型运行时可理解为新一代 TFLite之上的编排层分词器、会话管理、提示词模板、硬件后端全部打包成统一 API。它已经在 Chrome、Chromebook Plus、Pixel Watch 上支撑 Google 自家的端侧 GenAI 体验属于生产环境验证过而不是玩具实验。 核心能力跨平台、加速、多模态、工具调用能力可以拆成四块跨平台同一份模型文件Android、iOS、Web、桌面、IoT 通吃硬件加速GPU、NPU 后端v0.16.0 新增实验性 YNNPACK 纯 CPU 委托多模态视觉、音频输入omni/ 下还带语音识别ASR与语音合成TTS引擎工具调用内置函数调用能做端侧 Agent 工作流模型侧同样宽Gemma、Qwen、Llama、Phi-4、MiniCPM 等都在 models/ 里备好了提示词模板和元数据配置。量化版int4能把模型文件缩小数倍且不掉太多速度再叠加 MTP多 token 预测小 drafter 模型一次猜多个 token、主模型校验投机解码推理最快可提升 3 倍。那它到底跑多快预填充指模型处理输入 prompt 的阶段解码是逐 token 生成两者都以 tokens/s 计模型设备后端预填充 (tokens/s)解码 (tokens/s)Gemma3-1BMacBook Pro (M3)CPU603.883.0Gemma3-1BSamsung S24 UltraCPU379.755.9Gemma3-1BSamsung S24 UltraGPU2369.052.5Gemma3n-E2BMacBook Pro (M3)CPU232.527.6Gemma3n-E2BSamsung S24 UltraGPU816.415.6Gemma3n-E4BMacBook Pro (M3)CPU170.120.1端侧大模型部署的三个场景手机 App 内置助手Kotlin API 已稳定应用离线也能回答模型直接躺在 App 里树莓派 / 边缘节点v0.16.0 官方支持 CLI 在树莓派跑 Gemma4-E4B可开 GPU 后端与投机解码专治不允许有服务器的 IoT 场景桌面智能体工作流笔记本上跑 Gemma 4 12B本地文档私有化处理模型还能按需调用本地工具第三个场景里模型调用本地工具的完整闭环长这样⚡ 快速上手三条命令看到输出想亲手试试最快路径是官方 CLI不用写代码uv tool install litert-lm litert-lm run \ --from-huggingface-repogoogle/gemma-3n-E2B-it-litert-lm \ gemma-3n-E2B-it-int4 \ --promptWhat is the capital of France?想读源码先克隆仓库git clone https://gitcode.com/GitHub_Trending/li/LiteRT-LM构建以 Bazel 为首选CMake 是辅助路径仍在开发中详见 docs/getting-started/cmake.md。依赖C20 工具链gcc 13、Python 3.12ANTLR 解析器需要 Java 17部分子模块依赖 Rust 工具链。当前局限与版本状态说点实在的Python、Kotlin、C 三个 API 已稳定Swift 和 JavaScript 仍是早期预览Flutter 是社区维护。CMake 构建路径官方明确标注活跃开发中源码编译建议走 Bazel。YNNPACK 委托也是实验特性目前仅在 linux arm64 的 CLI 与 Python API 开启。当前版本 v0.16.0迭代很快。如果你要选型我的建议是AndroidKotlin或 Python 这两条稳定栈优先iOS / Web 可以跟进早期预览 API但要做好接口可能变动的准备。下一步很具体去仓库的 samples/ 和 python/litert_lm/examples/ 把示例跑一遍比看十篇文档都快。【免费下载链接】LiteRT-LMLiteRT-LM is Googles production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.项目地址: https://gitcode.com/GitHub_Trending/li/LiteRT-LM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考