SkyPilot Agent Skills 实战指南:让 AI Agent 自动拉起集群、跑训练并托管模型推理

SkyPilot Agent Skills 实战指南:让 AI Agent 自动拉起集群、跑训练并托管模型推理 SkyPilot Agent Skills 实战指南让 AI Agent 自动拉起集群、跑训练并托管模型推理【免费下载链接】skypilotThe AI Compute Platform for frontier teams. SkyPilot turns fragmented AI compute into one AI supercomputer, so frontier AI teams build custom intelligence faster.项目地址: https://gitcode.com/GitHub_Trending/sk/skypilot导读SkyPilot 在仓库中提供了一份官方 Agent SkillAI Agent 技能包它可以把 Claude Code、Codex 等编码智能体训练成一名熟练的 SkyPilot 操作员智能体可以自动启动 GPU 集群、提交训练任务、以负载均衡方式托管模型服务并管理跨多云的计算资源。本文将带你完整理解这份技能包的结构与安装方式深入剖析技能包内建的任务 YAML 规范、GPU 选型与集群生命周期管理策略并结合仓库内的两个端到端实战案例并行自动科研与自主代码优化说明如何把一个 Agent 16 块 GPU 在 8 小时内跑完约 910 个实验这类工作流复用到你自己的项目中。什么是 SkyPilot Agent SkillSkyPilot Agent Skill 是一套面向 AI Agent 的使用手册存放在仓库的 agent/skills/skypilot 目录下。它的核心思想是与其让 Agent 在每次对话中从头摸索sky命令的用法不如把经过工程验证的操作经验直接打包成 Agent 可加载的指令文件让 Agent 学会启动集群、运行任务、托管模型Clusters / Managed Jobs / SkyServe 三大抽象读取并编写任务 YAML 配置文件在 GPU 缺货、抢占、配额受限时自动故障转移对比跨云 GPU 价格、选择最便宜的可用实例排查 resources not available 之类的常见错误。技能包的文件结构如下agent/ ├── INSTALL.md # 安装与更新说明 ├── skills/skypilot/ │ ├── SKILL.md # 技能主文件Agent 优先阅读 │ ├── evals/evals.json # 技能行为评估用例 │ └── references/ │ ├── advanced-patterns.md # 多云、分布式训练等高级模式 │ ├── cli-reference.md # 完整 CLI 参考 │ ├── examples.md # 可直接复制的 YAML 示例 │ ├── job-investigation.md # 托管任务状态诊断 │ ├── migrating-from-slurm.md # 从 Slurm 迁移 │ ├── python-sdk.md # Python SDK 用法 │ ├── troubleshooting.md # 错误诊断 │ └── yaml-spec.md # 完整 YAML 规范自动生成其中 SKILL.md 是技能的核心入口Agent 会先读取它再按需进入references/下的专题文档yaml-spec.md由 agent/scripts/generate_references.py 从 docs/source/reference/yaml-spec.rst 自动生成保证文档与实现始终同步。安装 SkyPilot Skill技能包支持多种安装方式对应不同 Agent 环境。仓库中的 agent/INSTALL.md 给出了详细步骤。方式一Claude Code推荐如果你的 Agent 是 Claude Code可以直接通过插件市场安装一条命令搞定claude plugin marketplace add skypilot-org/skypilot claude plugin install skypilotskypilot只要没有报错即安装成功。安装后 Claude Code 会自动跳过后续的通用安装步骤。方式二npx skillsskills.sh如果你已经安装了npx skills也可以用它来安装npx skills add skypilot-org/skypilot方式三通用方式任何 Agent对不特定于某种 Agent 的环境可以直接让 Agent 去读取并遵循仓库中的安装文档Fetch and follow agent/INSTALL.md to install the SkyPilot skill通用的手动安装流程为# 1. 克隆仓库到本地 mkdir -p ~/.agents git clone https://github.com/skypilot-org/skypilot.git ~/.agents/.skypilot # 2. 创建技能符号链接 mkdir -p ~/.agents/.skills ln -s ~/.agents/.skypilot/agent/skills ~/.agents/.skills/skypilot # 3. 验证链接是否生效 ls -la ~/.agents/skills/skypilot安装完成后你可能需要重启 Agent 才能让技能被重新加载。更新技能因为技能是通过符号链接引用的更新仓库即可即时生效cd ~/.agents/.skypilot git pull origin master首次使用Agent Bootstrap技能安装好后Agent 并不会立即掌握你的云环境。在 SKILL.md 的 Before You Start 章节中定义了一套 Bootstrap 流程Agent 会在真正执行任务前自动完成环境确认。你也可以主动告诉 Agent Bootstrap SkyPilot 让它立即执行。Step 1检查安装与 API Server 连通性sky api info根据输出判断下一步动作输出内容含义下一步Server version and statusServer 正常运行且已连接Bootstrap 完成直接开始用户任务No SkyPilot API server is connected未连接 Server启动或连接一个 ServerCould not connect to SkyPilot API server远程 Server 不可达或认证过期建议用户执行sky api login --relogin -e endpointcommand not found: skySkyPilot 未安装执行安装流程如果sky命令不存在Agent 会按需安装只装用户需要的云插件pip install skypilot[aws,gcp,kubernetes]如果 Server 未运行Agent 会询问用户是连接已有 Server 还是本地启动sky api login -e API_SERVER_URL # 连接已有 Server sky api start # 本地启动 ServerStep 2检查云凭证仅全新环境需要sky check -o json该命令会以 JSON 形式列出各云平台是enabled还是disabled及原因。若目标云不可用可按 references/troubleshooting.md 中的凭证配置指引处理。仓库中的 agent/test/diagnose.py 展示了如何用claude -p --plugin-dir直接对技能包做冒烟测试验证技能能否被正确加载并响应写一份 8xH100 spot 任务 YAML这类请求evals/evals.json 则定义了更细粒度的行为断言例如Server 已运行时不得重复执行sky check/sky api start确保 Agent 不会做多余操作。SkyPilot 的三大核心抽象技能包把 SkyPilot 的能力收敛为三种抽象对应工作流的三个阶段Agent 会根据任务类型自动选用抽象命令适用场景特点SkyPilot Clusterssky launch/sky exec交互式开发与调试集群保持运行直到你 stop/down适合原型验证、短实验Managed Jobssky jobs launch长时间无人值守训练/批处理自动管理供给、执行、恢复、销毁全生命周期自动从 spot 抢占、配额限制、瞬时故障中恢复SkyServesky serve up生产级模型托管负载均衡、自动扩缩容、多云副本适合模型推理端点技能包明确建议先在sky launch上把服务调通再切到sky serve up做规模化部署。能力总览Agent 能替你做什么原文档给出了 Agent 借助技能包可以完成的典型任务清单这里完整保留并补充对应实现能力示例需求交互式开发环境启动一台 H100 集群把我的 VS Code 连上去空闲 30 分钟后自动停机。启动开发集群启动 4 台 A100 集群安装 PyTorch空闲 30 分钟后自动停机。微调模型在我的数据集 s3://my-data/train.jsonl 上微调 Llama 3.1 8B使用 spot 实例并支持抢占恢复。分布式训练用 PyTorch DDP 在 4 个节点上训练每节点 8 块 H100。超参搜索并行扫描学习率 [1e-4, 1e-5, 1e-6]在任意有货的云上运行。模型托管用 vLLM 部署 Llama 3.1 70B按 QPS 从 1 个副本自动扩容到 3 个。多云故障转移提交训练任务优先尝试我们的 Slurm 集群满了再回退到 AWS。GPU 价格对比AWS、GCP、Lambda、CoreWeave 上最便宜的 8x H200 是哪个排查 SkyPilot 问题我的 task.yaml 报 resources not available帮我调试修复。其中多云故障转移正是技能包反复强调的默认行为——只要不写死infraSkyPilot 优化器会自动在所有已启用云/区域间按价格与可用性挑选详见下文 GPU 选型章节。核心命令速查技能包按三大抽象组织了核心命令并强调状态/查询类命令尽量加-o json拿到结构化输出避免解析面向人类的表格。Clusters交互式开发sky launch -c NAME task.yaml # 启动集群或运行任务 sky exec NAME task.yaml # 在已有集群上运行跳过供给每次同步 workdir sky exec NAME task.yaml -d # 同上但立即返回不流式输出日志 sky status -o json # 列出所有集群 sky logs NAME # 流式查看作业日志 sky logs NAME --no-follow # 只打印已有日志后退出 sky logs NAME --tail 50 # 只打印最后 50 行 sky logs NAME --status # 按退出码判断0成功 100失败 101未完成 102未找到 103已取消 sky queue NAME -o json # 列出集群上的作业与状态 sky stop NAME / sky start NAME # 停机/重启保留磁盘省钱 sky down NAME # 彻底销毁集群 sky gpus list -o json # 列出各云可用 GPU 型号Managed Jobs长时任务sky jobs launch task.yaml # 启动托管作业自动生命周期恢复 sky jobs queue -o json # 查看所有托管作业及状态 sky jobs logs JOB_ID # 流式查看日志 sky jobs cancel JOB_ID # 取消作业SkyServe模型托管sky serve up serve.yaml -n NAME # 启动托管服务 sky serve status NAME # 查看服务状态与端点 URL sky serve update NAME new.yaml # 滚动更新服务 sky serve down NAME # 销毁服务完整的命令与参数说明见 references/cli-reference.md。任务 YAML 结构Agent 的核心编程界面任务 YAML 是 SkyPilot 的主要接口技能包强调所有字段都是可选的。下面是技能包给出的最小可运行示例我们在其基础上补充了注释# task.yaml name: my-training-job # 本地目录会被同步到远端 ~/sky_workdir workdir: . # 节点数分布式训练用 num_nodes: 1 resources: # GPU/TPU 加速器SkyPilot 自动选择最便宜的云/区域 accelerators: H200:8 # 可选固定到具体云/区域/基础设施 # infra: aws # 或 aws/us-east-1、k8s、ssh/my-pool # 不写 infra 时SkyPilot 自动在所有已启用云/区域间故障转移 # 找到最便宜的可用选项 use_spot: false # 用 spot 实例省钱 disk_size: 256 # 磁盘大小GB ports: 8080 # 对外开放的端口服务场景 # 环境变量在 file_mounts、setup、run 中均可访问 envs: MODEL_NAME: my-model BATCH_SIZE: 32 # setup集群创建时执行一次复用集群时被缓存 setup: | pip install torch transformers # run主命令 run: | python train.py --model $MODEL_NAME --batch-size $BATCH_SIZE字段深度解析结合 yaml-spec.mdyaml-spec.md对每个字段给出了权威说明这里提取最关键的几个workdir可以是本地目录整目录 rsync 到远端或 Git 仓库。若为 Git 仓库需提供url与ref分支/标签/commit hash私有仓库可通过GIT_TOKEN环境变量HTTPS或 SSH 密钥链SSH/SCP认证。注意workdir在每次sky launch/sky exec时都会被重新同步。resources.accelerators三种写法——单个型号H100:4有序列表[L4:1, H100:1, A100:1]按顺序尝试无序集合{L4:1, H100:1, A100:1}联合优化优先最便宜的。resources.infra格式为cloud/region/zoneregion/zone 可选或k8s/context-name支持任意组件的通配符例如aws/us-east-1、aws/*/us-east-1a、k8s/my-context。resources.use_spot默认false按需实例。置true使用 spot 实例以显著降低成本。resources.disk_size/disk_tier磁盘大小支持256或256GB等带单位写法tier 可选low/medium/high/ultra/best默认mediumbest表示使用已启用云上最好的磁盘档位。resources.ports暴露到公网的端口支持单端口、区间10052-10100或列表底层会自动添加防火墙/入站规则目前仅支持 TCP。端口生命周期新端口在sky launch时加入旧端口规则在集群销毁前不会被移除。resources.max_hourly_cost实例小时成本上限美元优化器只考虑价格不高于该值的实例use_spot为 true 时作用于 spot 价格否则作用于按需价格。resources.any_of/ordered候选资源集合。any_of由优化器决定故障转移顺序价格优先ordered则严格按用户给定顺序 failover。两者外层字段作为候选的默认值内层字段覆盖默认值。resources.job_recovery托管作业的恢复策略。strategy可选FAILOVER同区域重试无资源再换区域或EAGER_NEXT_REGION直接换区域默认适用于 spot 抢占频发的场景还可配置max_restarts_on_errors用户代码错误的恢复次数上限与recover_on_exit_codes指定退出码如 NCCL 超时始终触发恢复不占用上述上限。envs/secrets两者都可在file_mounts、setup、run中引用且都能被 CLI 的--env/--secret覆盖区别是secrets只能在 setup/run 中使用且会在 Dashboard 的入口与 YAML 展示中打码。file_mounts本地路径→远端路径的 rsync 同步/remote/dir: /local/dir或云存储桶挂载source: s3://...mode: MOUNT / COPY / MOUNT_CACHED。MOUNT_CACHED可配合预调优的负载类型typeMODEL_CHECKPOINT_RO、MODEL_CHECKPOINT_RW、DATASET_RO、DATASET_RW。setup/runsetup每次sky launch都会执行、位于run之前run在集群每个节点上执行。config高级选项例如config.slurm.sbatch_options透传给 sbatch 的指令、config.hooks生命周期钩子事件包括stop、preemption、down等。GPU 选型与多云策略技能包对 GPU 选型有一条强约束让 SkyPilot 自己选云和区域不要人工从sky gpus list输出里挑云/区域/实例。理由是优化器会自动在所有已启用云间选择最便宜的可用选项。默认行为是只写 GPU 型号resources: accelerators: H200:8 # SkyPilot 自动选择有 H200:8 的最便宜的云/区域如果用户没指定 GPUAgent 应询问用户需要什么 GPU或根据模型/负载推荐而不是替用户跑sky gpus list挑一个。需要最大化可用性时用any_of给出多个可接受型号resources: any_of: - accelerators: H100:8 - accelerators: A100-80GB:8 - accelerators: A100:8用户有明确偏好时才用orderedresources: ordered: - infra: aws/us-east-1 accelerators: H100:8 - infra: gcp/us-central1 accelerators: H100:8 - infra: aws/us-west-2 accelerators: A100-80GB:8只有用户明确说用 AWS或跑在 GCP us-central1时才设置infra:。类似的约束也体现在技能包的常见 Agent 错误表中手动挑云、硬编码infra: aws、使用已废弃的cloud:/region:/zone:字段已被infra:取代都会限制可用性并推高成本。集群生命周期与成本控制技能包把集群生命周期管理总结为一组命令核心原则是用 autostop 代替事后清理避免为闲置集群买单# 启动时直接设置自动停机推荐省一条后续命令 sky launch -c mycluster task.yaml -i 30 # 空闲 30 分钟后停机 sky launch -c mycluster task.yaml -i 30 --down # 空闲 30 分钟后销毁 # 通过 CLI 覆盖环境变量 sky launch -c mycluster task.yaml --env MODEL_NAMEllama3 --env BATCH_SIZE64 # 复用同一集群跑另一个任务跳过供给速度快 sky exec mycluster another_task.yaml sky exec mycluster -- python train.py --epochs 10 # 启动后补设 autostop sky autostop mycluster -i 30 # 停机并保留磁盘可用 sky start 恢复 sky autostop mycluster -i 30 --down # 销毁磁盘删除不可恢复 # 手动停机/重启/销毁 sky stop mycluster sky start mycluster sky down mycluster-i的完整语义在 cli-reference.md 中有说明集群空闲无运行中/等待中的作业指定分钟后自动停止--wait-for可控制空闲计时器的重置条件jobs_and_ssh默认 /jobs/none。在 YAML 中也可以直接写resources.autostop支持true默认 5 分钟、数字分钟、带单位10h、或对象形式idle_minutesdownwait_for。workdir 同步的一个陷阱技能包特别提醒workdir通过 rsync 同步到~/sky_workdir而rsync 是增量的——本地删除的文件不会从远端移除这会导致实验跑在过期的构建产物或旧配置上。解决方式是在sky exec前手动清空远端目录或在run:内清理特定产物ssh mycluster rm -rf ~/sky_workdir sky exec mycluster task.yamlManaged Jobs无人值守的长任务对于需要无人值守的长时间训练/批处理任务应使用sky jobs launch而非sky launch。SkyPilot 托管完整生命周期——供给、执行、从抢占/配额/故障中恢复、销毁# managed-job.yaml name: training-job resources: accelerators: A100:8 run: | python train.py --resume-from-checkpointsky jobs launch managed-job.yaml sky jobs queue -o json sky jobs logs job_id sky jobs cancel job_id技能包强调检查点模式训练脚本应把检查点保存到持久化存储云桶或卷并在重启时从最新检查点恢复。SkyPilot 负责集群层面的恢复你的脚本负责状态层面的恢复——两者分工明确。当用户问我的作业在干什么/为什么 pending 或失败时技能包给出了最短路径# -v 提供 details 字段未启动的作业details 就是答案例如 Slurm 队列等待原因 sky jobs queue -v -o json # 最近的任务输出--controller 查看供给/恢复日志 sky jobs logs JOB_ID --tail 100 --no-followreferences/job-investigation.md 对details的常见取值做了逐一解读例如Waiting for higher priority jobs to launch时应在 YAML 中提高priorityIn backoff, waiting for resources时应查看 controller 日志中的最近失败原因。SkyServe生产级模型托管托管服务的 YAML 在普通任务字段之外增加service:段# serve.yaml resources: accelerators: A100:1 ports: 8080 run: | python -m vllm.entrypoints.openai.api_server \ --model meta-llama/Llama-3.1-8B-Instruct \ --port 8080 service: readiness_probe: /v1/models replica_policy: min_replicas: 1 max_replicas: 3 target_qps_per_replica: 5sky serve up serve.yaml -n my-llm sky serve status my-llm sky serve status my-llm --endpoint sky serve update my-llm new-serve.yaml sky serve down my-llm关键的service参数完整规范见 yaml-spec.mdreadiness_probe必需探活路径返回 200 即视为副本就绪并开始引流。支持简写字符串或详细对象path、post_data、initial_delay_seconds默认 1200、timeout_seconds默认 15、endpoint_probe_interval_seconds默认 10、consecutive_failure_threshold_timeout。replica_policy基于 QPS 的自动扩缩容。min_replicas必填max_replicas缺省时使用固定副本数只有设置了target_qps_per_replica才会启用自动扩缩容upscale_delay_seconds默认 300与downscale_delay_seconds默认 1200用于防止抖动的稳定期。load_balancer.stream_timeout_seconds负载均衡转发请求流的超时默认 120 秒。replicas固定副本数写法是不需要自动扩缩容时的简化替代。端到端实战两个官方 Recipe技能包内置了两个经过验证的端到端案例原文档以卡片形式呈现这里展开讲解。案例一并行自动科研Parallel Autoresearch一个 Agent 在 8 小时内、16 块 GPU 上运行了约 910 个实验验证损失改善 2.87%。完整说明见 examples/autoresearch/README.md。工作架构如下本地 AgentClaude Code、Codex 等负责生成假设、编辑train.py、在本地results.tsv中记录结果SkyPilot Skill 负责全部基础设施操作——启动 GPU 集群、提交实验、查看状态与日志、SSH 进集群检查产出、销毁闲置集群。SkyPilot Agent 并行科研工作流架构任务模板 examples/autoresearch/experiment.yaml 体现了技能包反复强调的几个要点resources: accelerators: {H100:1, H200:1} # 无序集合H100/H200 谁便宜用谁 image_id: docker:nvcr.io/nvidia/pytorch:24.07-py3 workdir: . envs: EXPERIMENT_ID: baseline EXPERIMENT_DESC: baseline run setup: | pip install uv uv sync uv run prepare.py run: | uv run train.py 21 | tee run.log EXIT_CODE${PIPESTATUS[0]} # 解析 val_bpb / peak_vram输出 EXPERIMENT_STATUS / EXPERIMENT_RESULT 供 Agent 追踪运行节奏源自 examples/autoresearch/instructions.md# 启动一台集群跑第一个实验-d 立即返回、-y 跳过确认 sky launch gpu-01 experiment.yaml --env EXPERIMENT_IDexp-01 --env EXPERIMENT_DESCbaseline -d -y # 在同一集群上排队跑下一个实验复用供给走作业队列 sky exec gpu-01 experiment.yaml --env EXPERIMENT_IDexp-02 --env EXPERIMENT_DESCincrease LR -d # 并行的代码变体把代码复制到独立目录后用 --workdir 指向 mkdir -p /tmp/autoresearch/exp-03 cp train.py prepare.py pyproject.toml experiment.yaml /tmp/autoresearch/exp-03/ sky launch gpu-03 experiment.yaml --workdir /tmp/autoresearch/exp-03 --env EXPERIMENT_IDexp-03 -d -y实验循环为检查results.tsv/sky status/sky queue→ 挑选新想法 → 准备代码 → 以-d方式提交 → 不等待、继续下一个想法 → 周期性用sky logs或 SSH 收集结果 → 淘汰失败实验、提交胜出者 → 销毁闲置集群sky down -a -y。技能包强调NEVER STOP——除非手动停止否则持续工作。并行 vs 顺序实验结果对比官方文档记录的实际结果并行 Agent 相比顺序执行达到相同最佳验证损失快 9 倍吞吐约 90 实验/小时顺序仅约 10/小时val_bpb从 1.003 改善到 0.9742.87%成本约为 9 美元 API 调用 300 美元 GPU 算力。案例二自主代码优化Autonomous Code Optimization先读论文再做代码Agent 在 llama.cpp 中找到了内核融合优化点——CPU 生成速度提升 15%。完整说明见 examples/autonomous-code-optimization/README.md。与案例一的区别在于目标是任意开源项目不限于 ML 训练计算资源是廉价 CPU VM而非 GPU 集群搜索策略从凭代码直觉头脑风暴升级为阅读 arXiv/仓库 fork/PR 寻找优化灵感 剖析瓶颈。# 一条命令搭建安装 SkyPilot、克隆目标仓库、下载模板 export TARGET_REPOhttps://github.com/org/project.git curl -fsSL https://raw.githubusercontent.com/skypilot-org/skypilot/master/examples/autonomous-code-optimization/setup.sh | bash任务模板 examples/autonomous-code-optimization/experiment.yaml 展示了 CPU 场景的资源写法与可参数化 envsresources: cpus: 4 memory: 8 # 无 GPU —— 面向 CPU 密集型代码优化目标需要 GPU 时用 --gpus 覆盖 workdir: . envs: EXPERIMENT_ID: baseline EXPERIMENT_DESC: baseline measurement BUILD_CMD: make -j$(nproc) BENCH_TIMEOUT: 300 CHECK_TIMEOUT: 300 setup: | cd ~/sky_workdir if [ -f setup_deps.sh ]; then bash setup_deps.sh else bash -c ${BUILD_CMD} fi run: | # 构建 → 基准测试autoresearch.sh→ 正确性校验autoresearch.checks.sh # 输出 METRIC 行让 Agent 能结构化解析结果Agent 会自己编写基准脚本与正确性校验脚本然后循环执行剖析 → 检索文献 → 实验 → 提交胜出者 → 重复。Agent 反馈循环程序化使用 SkyPilot 的正确姿势技能包为 Agent 定义了标准的操作循环也是任何自动化工作流都可以借鉴的最佳实践校验sky launch --dryrun task.yaml检查资源可用性与成本不真正供给启动sky launch -c mycluster task.yaml监控sky status -o json与sky queue mycluster -o json等待完成sky logs mycluster JOB_ID流式阻塞不需要中间输出时用--status静默等待检查输出sky logs mycluster JOB_ID --no-follow或--tail 100调试ssh mycluster交互式排查迭代sky exec mycluster updated_task.yaml复用集群清理sky down mycluster技能包特别强调绝不要用sleepsky queue轮询而应该用sky logs CLUSTER JOB_ID流式阻塞或用--status只取退出码、--tail N取最近输出。常见错误与排查速查技能包把 Agent 高频犯的错误整理成了对照表这里节选最关键的部分错误原因正确做法从sky gpus list输出手工挑云/区域优化器自动完成且更优只写accelerators:让 SkyPilot 选长时无人值守任务用sky launch被抢占/中断后无恢复用sky jobs launch做完不清理集群闲置集群持续计费启动时就用-i minutes --down没征求用户就硬编码infra: aws限制可用性、抬高成本仅在用户明确指定云时设置不用envs:做参数化难以复用/从 CLI 覆盖YAML 写envs: CLI 用--env KEYVALsky launch不加-c name生成随机名难以引用始终用-c命名集群解析 status 的表格输出表格面向人类解析脆弱用-o json结构化输出用已废弃的cloud:/region:/zone:已被infra:取代用infra: aws/us-east-1用sleepsky queue轮询浪费 token、有竞态用sky logs CLUSTER JOB_ID --status阻塞常见问题速查问题解决GPU 不可用用any_of提供备选或换区域/云setup 太慢setup 有缓存重跑用sky exec跳过任务静默失败检查sky logs cluster或ssh cluster集群卡在 INITsky down cluster后重新拉起抢占/配额用sky jobs launch自动恢复端口不通确认resources.ports:已设置且安全组放行文件同步慢大数据集用云桶挂载替代workdir凭证报错sky check -o json查看哪些云被禁用如需从 Slurm 迁移工作负载references/migrating-from-slurm.md 提供了一套完整的指令映射--time不能映射到autostop而是config.slurm.sbatch_options.timesrun cmd通常应丢弃而不是翻译sbatch --array映射为sky jobs launch --num-jobs N并用sky launch --dryrun校验注意sky jobs launch没有--dryrun。小结SkyPilot Agent Skill 的本质是把多云计算资源管理这一层从你的工作流中剥离出来交给智能体处理。你只需要在技能包之上描述意图微调这个模型、扫这三组学习率、用 spot 并支持抢占恢复Agent 就会依据 SKILL.md 及其参考资料自动完成 YAML 编写、集群供给、任务提交、状态监控与成本清理。两个官方案例分别证明了它在 GPU 密集科研与 CPU 代码优化两个方向上的可复现性——而这一切的入口都只是安装技能后对 Agent 说一句Bootstrap SkyPilot。【免费下载链接】skypilotThe AI Compute Platform for frontier teams. SkyPilot turns fragmented AI compute into one AI supercomputer, so frontier AI teams build custom intelligence faster.项目地址: https://gitcode.com/GitHub_Trending/sk/skypilot创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考