OpenResearch Slurm集群教程:从登录节点提交GPU批处理实验

OpenResearch Slurm集群教程:从登录节点提交GPU批处理实验 OpenResearch Slurm集群教程从登录节点提交GPU批处理实验【免费下载链接】OpenResearchTurn your coding agents into research agents项目地址: https://gitcode.com/GitHub_Trending/op/OpenResearchOpenResearch是一款把 Claude Code、Codex、Cursor 等编码智能体变成科研智能体的本地工作区工具它内置 Slurm 后端让你一条命令就能从 Slurm 集群的登录节点提交 GPU 批处理实验无需手动编写 sbatch 脚本。本教程带你快速完成配置登录节点别名 → 一键提交 GPU 实验 → 追踪作业日志与状态适合刚接触集群训练的科研新手。Slurm 后端OpenResearch 的集群加速通道 传统流程里你要自己 SSH 到登录节点、拷贝代码、手写.sbatch脚本、盯squeue等结果。OpenResearch 的 Slurm 后端把整条链路自动化SSH 连接登录节点 → 暂存实验的不可变代码快照 → 自动生成 sbatch 脚本 →sbatch提交 → 后台监督进程追踪状态核心流程实现在 src/local/slurm.rs 中提交成功后会输出作业 ID 和 run ID并自动拉起一个分离的orx supervise进程持续记录调度器状态与日志。一键安装步骤配置你的 Slurm 登录节点OpenResearch 通过~/.ssh/config中的主机别名访问登录节点不需要任何额外密钥——它直接复用你已有的 SSH 认证。1. 准备 SSH 别名在你的~/.ssh/config中配置登录节点假设别名为login-nodeHost login-node HostName your.cluster.edu User yourname2. 可选设置集群默认值OpenResearch 会把 Slurm 默认配置存放在$XDG_CONFIG_HOME/openresearch/slurm.json支持四个可选字段字段对应 sbatch 指令说明host—默认登录节点SSH 别名partition--partition默认队列account--account计费/配额账户time_limit--time默认时限支持4h、30m语法单队列集群无需任何配置即可直接运行配置解析逻辑见 src/jobs/slurm.rs。最快配置方法提交第一个 GPU 批处理实验提交前必须做两件事先提交代码所有后端都运行已记录 commit 的不可变源码快照未提交的文件不会被带上集群也无需推送到 GitHub固定 run 命令在基线实验上设置一次训练命令之后在子分支上变更代码或超参数提交命令orx exp run expId --backend slurm --host login-node --flavor h100:2 --timeout 4h--flavor会被自动翻译成 Slurm 的 GRES GPU 请求映射规则见 src/jobs/slurm.rs--flavor生成的--gresgpugpu:1h100gpu:h100h100:2gpu:h100:2关键特性 ⚡没有镜像概念作业直接使用集群环境modules、conda、登录 profile因此--image参数在 Slurm 后端会直接报错CPU 作业省略--flavor即可CPU/内存由队列默认值决定若误传--flavor cpuOpenResearch 会给出清晰的纠正提示而非晦涩的 sbatch 报错超时默认 4 小时覆盖整个批作业可用--timeout覆盖后端使用契约详见 references/slurm.md追踪实验查看状态、日志与等待完成提交后orx exp run立即返回后续用以下命令管理orx runs projectId # 查看项目所有 run 及状态 orx logs runId # 查看作业日志sbatch 已把 stdout/stderr 归入同一个 log orx exp status expId # 分支、父节点、run 命令、最新 run commit orx exp wait expId # 阻塞等待 run 状态变化默认间隔 5s orx exp cancel expId # 取消进行中的 run新手提示那个在后台运行的orx supervise分离进程负责轮询调度器状态不要杀掉它等待返回后应再执行orx runs做一次状态对账。失败的 run 会在输出中带reason:行启动后的失败需要读日志定位原因。常见陷阱与最佳实践清单 ✅❌ 直接在集群上手动跑训练命令 —— 绕过orx exp run的作业不会被追踪且可能运行了非记录 commit 的代码❌ 一上来就申请最大 GPU —— 先选能装下模型 最小 batch 的最小规格遇到真实 OOM 再升级❌ 忘记 commit 就提交 —— 未提交改动不会进入快照✅ 同一实验已有在跑作业时orx会拒绝重复提交确需并发请加--force✅ 计算资源选型决策可参考 agent-skills/orx-compute/SKILL.md 中的 Sizing compute 章节相关资料速查 文件说明agent-skills/orx-compute/references/slurm.mdSlurm 后端官方使用指南src/jobs/slurm.rssbatch 脚本生成、GRES 映射、作业监控核心实现src/local/slurm.rs本地实验 → Slurm 批作业的提交流程agent-skills/orx-compute/SKILL.md全后端统一启动契约与等待/唤醒机制README.md项目总览、安装与 CLI 常用命令按照以上步骤你就能把日常训练任务从手写 sbatch 盯队列升级为 OpenResearch 实验树上的一次可复现 run让科研智能体在集群 GPU 上并行探索多个方向。【免费下载链接】OpenResearchTurn your coding agents into research agents项目地址: https://gitcode.com/GitHub_Trending/op/OpenResearch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考