图片理解与视频分析:Ornith-1.5-9B多模态输入完整使用指南

图片理解与视频分析:Ornith-1.5-9B多模态输入完整使用指南 图片理解与视频分析Ornith-1.5-9B多模态输入完整使用指南【免费下载链接】Ornith-1.5-9B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-9BOrnith-1.5-9B 是 Ornith-1.5 家族中最轻量级的多模态模型原生支持图片理解与视频分析。本文是一份面向新手的完整指南只需一张 80GB 显卡即可部署本地多模态服务并通过 OpenAI 兼容接口发送图片和视频几分钟内跑通第一个多模态问答。 快速定位模型配置视觉编码器、图像/视频 tokenconfig.json图片预处理参数preprocessor_config.json视频抽帧参数processor_config.json、video_preprocessor_config.json多模态消息模板chat_template.jinja多模态能力一览Ornith-1.5-9B 能看懂什么很多人以为 9B 模型只能聊天其实 Ornith-1.5-9B 内置了完整的视觉编码器qwen3_5_vision27 层与文本主干共享同一个推理上下文。从 config.json 可以看到几个关键证据能力配置项说明️ 图片输入image_token_id: 248056图片被切分为 16×16 像素块patch再 2×2 合并后送入模型 视频输入video_token_id: 248057视频每 2 帧合并为一组temporal_patch_size: 2保留时序信息 视觉边界标记vision_start/end_token_id自动包裹视觉内容无需手工处理⚡ 长上下文max_position_embeddings: 262144默认 262K token 上下文图片/视频都会占用其中的一部分它的定位是单卡可部署的多模态模型bf16 权重约 19GB一张 80GB 显卡即可完整服务详见 README.md。一键部署本地多模态模型服务多模态模型部署最怕装一堆插件Ornith-1.5-9B 不需要任何额外配置——视觉能力直接内置在权重里用 vLLM 或 SGLang 一行命令即可拉起 OpenAI 兼容服务。硬件与运行时要求GPU单张 80GB 显存bf16 约 19GB加上 KV 缓存绰绰有余运行时版本Transformers ≥ 5.8.1、vLLM ≥ 0.19.1、SGLang ≥ 0.5.9想多卡扩展时加--tensor-parallel-size/--tp分片即可使用 vLLM 启动推荐vllm serve ornith-ai/Ornith-1.5-9B --served-model-name Ornith-1.5-9B --host 0.0.0.0 --port 8000 --max-model-len 262144 --gpu-memory-utilization 0.90 --enable-prefix-caching --enable-auto-tool-choice --tool-call-parser qwen3_xml --reasoning-parser qwen3 --trust-remote-code使用 SGLang 启动python -m sglang.launch_server --model-path ornith-ai/Ornith-1.5-9B --served-model-name Ornith-1.5-9B --host 0.0.0.0 --port 8000 --context-length 262144 --mem-fraction-static 0.85 --tool-call-parser qwen3_coder --reasoning-parser qwen3 服务启动后任意 OpenAI 兼容 SDKPython、Node.js或curl都可访问/v1/chat/completions端点。图片理解如何发送图片给多模态模型图片理解的用法和主流多模态 API 完全一致把用户消息的content从字符串改成内容数组放入image_url和text两个元素即可。import base64 from openai import OpenAI client OpenAI(base_urlhttp://localhost:8000/v1, api_keyEMPTY) with open(chart.jpg, rb) as f: img base64.b64encode(f.read()).decode() response client.chat.completions.create( modelOrnith-1.5-9B, messages[{role: user, content: [ {type: image_url, image_url: {url: fdata:image/jpeg;base64,{img}}}, {type: text, text: 请解读这张图表并给出关键结论。} ]}], temperature1.0, top_p0.95, max_tokens2048, ) print(response.choices[0].message.content)三个实用细节对应 chat_template.jinja 的模板逻辑多张图自动编号一次发多张图时模板会自动生成Picture 1:、Picture 2:标记你可以直接在提问中用编号指代例如对比 Picture 1 和 Picture 2 的差异。图片不能放在 system 消息里模板会直接抛异常图片请一律放在 user 消息中。返回结构分两段Ornith-1.5-9B 是推理模型回答前会先输出think…/think推理过程服务端解析器会把它单独放到reasoning_content字段content字段只包含最终答案。视频分析如何发送视频给多模态模型视频分析的原理是抽帧处理器按 processor_config.json 中的参数从视频里采样若干帧再按时间顺序拼进上下文。默认参数对新手非常友好参数默认值含义fps2每秒抽取 2 帧min_frames4至少抽 4 帧保证短视频也有足够信息max_frames768最多 768 帧防止超长视频撑爆上下文举个例子一段 3 分钟的监控视频按 2fps 抽帧正好约 360 帧远低于上限而 10 分钟的视频会被截到 768 帧约覆盖前 6 分多钟重要片段请提前剪辑。发送方式与图片类似只需把类型换成video_url并支持本地文件路径response client.chat.completions.create( modelOrnith-1.5-9B, messages[{role: user, content: [ {type: video_url, video_url: {url: file:///data/video/clip.mp4}}, {type: text, text: 总结这段视频里发生了什么按时间线分点描述。} ]}], temperature1.0, top_p0.95, max_tokens4096, ) 技巧对视频提问时加上按时间线分点描述这类指令模型会更好地利用时序信息262K 的大上下文意味着你甚至可以图片和视频混排在同一轮对话里对比。关键参数速查采样与长上下文官方推荐的采样参数分两档来自 README.md场景temperaturetop_ptop_kpresence_penalty通用任务含图片/视频理解1.00.95201.5精确编码任务0.60.95200.0长上下文扩展YaRN262K 不够用时可在启动参数里追加rope_scalingYaRNfactor 4.0 可扩至约 1M token。vLLM 示例VLLM_ALLOW_LONG_MAX_MODEL_LEN1 vllm serve ornith-ai/Ornith-1.5-9B \ --hf-overrides {rope_scaling: {rope_type: yarn, factor: 4.0, original_max_position_embeddings: 262144}} \ --max-model-len 1000000 ...⚠️ 注意开源运行时对 YaRN 采用静态缩放普通长度的请求质量可能略有下降只在确实需要长窗口时再开启若请求最长约 524K token用factor: 2.0更合适。常见问题与实用建议图片太大会怎样图片按 16×16 像素块编码并 2×2 合并分辨率越高占用 token 越多。普通截图、照片直接发即可4K 大图建议先缩到 1080p 再上传性价比更高。视频报 token 超限先剪辑缩短时长或降低抽帧参数768 帧的上限已经很大超长视频建议分段分析后再让模型汇总。回答慢是正常的吗是的。它默认先推理后作答think块复杂视觉任务思考更久想只看最终结论取content字段忽略reasoning_content即可。想省显存跑在消费级显卡可关注官方的量化版 Ornith-1.5-9B-Mobile 与 GGUF 格式README.md 的 Agentic Usage 一节通过 llama.cpp 的llama-server同样能以 OpenAI 兼容方式服务。结语到这里你已经掌握了 Ornith-1.5-9B 多模态输入的全部要点一条命令部署本地服务 → 用内容数组发图片做图片理解 → 换video_url发视频做视频分析 → 按场景调采样参数。9B 的体量 262K 上下文 单卡部署让它成为自建多模态流水线里少有的即插即用选择。Chirp Chirp! 快去拿一张图片和一段视频试试效果吧。【免费下载链接】Ornith-1.5-9B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-9B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考