如何为小模型调优graphify知识图谱?--token-budget与并发参数实战经验 📅 发布时间:2026/8/30 13:01:12 👁 浏览次数: 如何为小模型调优graphify知识图谱--token-budget与并发参数实战经验【免费下载链接】graphifyTurn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable knowledge graph. A /graphify skill for Claude Code, Cursor, Codex, and Gemini CLI: local deterministic AST parsing, every edge explained, no vector store.项目地址: https://gitcode.com/GitHub_Trending/graph/graphifygraphify 是一款把代码库、文档、SQL 架构和 PDF 转化为可查询知识图谱的工具它提供/graphify技能接入 Claude Code、Cursor、Codex、Gemini CLI使用本地确定性 AST 解析、逐边可解释、无需向量数据库。当你想用 Ollama、llama.cpp 等本地小模型跑 graphify 时两个参数决定成败--token-budget控制每次发给模型的输入块大小和--max-concurrency控制并行 LLM 调用数。本文给出完整的调优思路与实战经验。两个参数到底控制什么理解参数的作用域才能调得准。graphify 的提取流程分为两阶段AST 解析阶段纯本地不调用模型——由--max-workers控制线程数语义提取阶段调用 LLM——由--token-budget决定输入块大小、--max-concurrency决定并行请求数参数默认值作用面向--token-budget60000把文件贪心打包进装得下的 chunkLLM 输入侧--max-concurrency4线程池并行调用 LLM 的上限LLM 请求侧--max-workers—AST 解析的并行线程数本地 CPUchunk 打包逻辑源码graphify/llm.py参数解析入口graphify/cli.py分块行为的测试用例tests/test_chunking.py小模型调优三步法第一步把 --token-budget 降到小模型能吃下的量小模型的上下文窗口通常只有 4k32k token默认的 60000 直接爆窗口。经验值# Ollama 本地推理8k 上下文窗口 4k 输入块安全起步 GRAPHIFY_OLLAMA_NUM_CTX8192 graphify extract ./docs --backend ollama --token-budget 4000 # llama.cpp / vLLM / LM Studio 等 OpenAI 兼容服务 OPENAI_BASE_URLhttp://localhost:8080/v1 OPENAI_MODELmy-model \ graphify extract ./docs --backend openai --token-budget 4000经验法则token-budget ≈ 模型上下文窗口的 1/3 左右。官方代码中甚至有提示逻辑——检测到上下文不够时会建议--token-budget {num_ctx // 3}见 graphify/llm.py。预算越小单块输出也越小越不容易被截断。第二步把 --max-concurrency 调低别让本地推理互相踩踏云端 API 不怕并发本地模型单卡/单进程同时处理 4 个请求只会更慢甚至 OOM# 本地推理建议降到 1~2 个并行请求 graphify extract ./docs --backend ollama --max-concurrency 2--max-concurrency 1即为严格串行排查问题时最好用集群命名阶段是另一回事大图的社区打标可以调高并发graphify cluster-only ./my-project --max-concurrency 16 --batch-size 200第三步慢模型要放宽超时、限制输出本地小模型生成一个 chunk 可能要几分钟默认的 600 秒超时可能不够graphify extract ./docs --api-timeout 900 --timing # 加长超时并打印各阶段耗时小显存 GPU 还可以让每个 chunk 处理完就卸载模型省 VRAMGRAPHIFY_OLLAMA_KEEP_ALIVE0 graphify extract ./docs --backend ollama常见报错与对策实战速查报错/现象对策Ollama 爆 VRAM / 上下文超限GRAPHIFY_OLLAMA_NUM_CTX8192--token-budget 4000LLM returned invalid JSONJSON 被截断graphify 会自动拆分 chunk 重试用--token-budget 4000或GRAPHIFY_MAX_OUTPUT_TOKENS16384缓解小模型输出被自己的 max-output 上限截断降低--token-budget是最可靠的杠杆请求 429 限流调低并发 GRAPHIFY_MAX_RETRIES默认 6 次一个容易混淆的点LLM returned invalid JSON警告不代表数据丢失——graphify 会把 chunk 拆成两半重新提取超大文档还会先按标题/段落边界切片保证全文覆盖详见 README.md 的 Troubleshooting 一节。相关源码与文档想深入阅读实现可以从这些文件入手分块与并行提取核心graphify/llm.pyCLI 参数解析--token-budget/--max-concurrency/--max-workersgraphify/cli.py后端适配与测试tests/test_llm_backends.py工作原理解释docs/how-it-works.md各后端环境变量全表README.md提取性能数据BENCHMARKS.md小结给小模型调 graphify 的心法一句话小模型 小块输入 低并发 长超时。先用--token-budget 4000起步、--max-concurrency 1~2兜稳跑通后再逐步放大参数换取速度。graphify 对截断、失败都有自动重试和拆分恢复机制大胆调参也不会丢数据。【免费下载链接】graphifyTurn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable knowledge graph. A /graphify skill for Claude Code, Cursor, Codex, and Gemini CLI: local deterministic AST parsing, every edge explained, no vector store.项目地址: https://gitcode.com/GitHub_Trending/graph/graphify创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考