AI 时代的工程师素养:不是会用模型,是能把模型管好
一、工具变了,核心能力没变
AI 工具在工程师群体中的渗透速度超出了几乎所有预测。半年前还在讨论"要不要让团队用 Copilot"的公司,现在已经把 GitHub Copilot 和 Cursor 的经费列入常规预算。写代码的方式确实在变——从逐行敲击到生成式补全,从翻阅文档到对话式问答。
但这一轮变化暴露了一个反直觉的事实:AI 工具放大了工程师之间的能力差距,而不是缩小了它。
为什么?因为会用模型生成代码太容易了——任何一个实习生花半小时就能学会。但能把模型生成的东西验证、测试、部署、运维起来的高质量交付,需要的是一整套和 AI 无关的工程素养。这些素养在十年前是版本控制、单元测试、CI/CD,在今天是同样的东西,但要再加上一个维度:模型服务的稳定性、成本和容错。
二、三个维度的能力重构
编程素养:不变的核心
优秀工程师的基本盘没有因为 AI 而变弱——相反,它变得更重要了。
代码质量意识是典型的例子。AI 生成的代码,质量方差极大——它可以在一个函数里同时写出优秀的错误处理逻辑和潜在的内存泄漏。如果你不能独立判断代码的质量,AI 就成了一个"加速制造技术债务"的工具。
单元测试的优先级因为 AI 而变得更高。一段 AI 生成的代码,你可能不是它的第一作者,但你必须是它的第一责任人。通过单元测试对 AI 生成的函数做行为验证、通过集成测试对推理调用链路做端到端验证——这些不是可选项,是底线。
Code Review 在 AI 时代的维度更多了。不仅要审查代码逻辑的正确性和边界条件,还要审查是否有 AI 引入的偏差——比如模型生成了一段对 GPU 进行重复计算的代码,在测试环境数据量小的情况下看不出问题,到了生产环境数据量一大就直接 OOM。
基础设施素养:新增的硬要求
基础设施素养是 AI 时代对工程师的全新要求。这个要求的核心是:你写的代码不再只是操作数据库和缓存,它还可能在操作 GPU、调用推理服务、处理流式响应。
GPU 资源理解是第一步。一个不知道 T4、A10、A100 之间差异的工程师,在面对长文本推理场景时,无法正确判断该用哪个 GPU 池子。一个不知道显存碎片化是怎么回事的工程师,面对 GPU 集群利用率异常偏低的情况只能求助运维——而运维可能此刻正在处理更紧急的 K8s 节点故障。
可观测性意识是第二步。AI 服务的特点是:它的质量不仅依赖代码逻辑,还依赖模型本身的质量和稳定性。同样的请求,在不同版本的模型下返回质量可以相差悬殊。工程师需要主动在代码里埋点——首 token 时间、推理耗时、token 消耗量、模型版本、是否是缓存命中——这些数据是后续做模型评估和成本分析的基础。
服务可靠性意识是第三步——也是最容易被忽视的一步。调用外部 API 时,永远假设它会超时、会返回错误、会变得不可用。在调用链路中设计重试逻辑(带指数退避)、熔断机制(连续 N 次失败后暂时停止调用)和降级策略(返回缓存结果或更基本的默认值)。
系统思维:从"写一个功能"到"负责一个生命周期"
AI 时代的工程师,系统思维的边界被大幅扩展了。
传统模式下,"完成开发"意味着代码合并到主分支,CI 管道通过,功能上线。但在 AI 服务场景下,"完成开发"只是一个起点——模型版本更新后推理质量会不会退化?GPU 实例从 T4 换到 A100 后成本变化有多大?推理队列深度飙到 20 的时候,你的代码是优雅降级还是直接崩溃?
这些问题不是 Ops 的职责,而是 Dev 要思考和处理的。你写的每一行调用推理服务的代码,都隐含着对服务可靠性的承诺。这个承诺需要你从写代码的那一刻就开始构思,而不只是在它出问题之后才开始补救。
三、素养不是原则,是可落地的行为
素养如果只停留在"应该有成本意识"、"应该重视可靠性"这种口号层面,它就没有价值。以下是六个可执行的行为标准,用来判断一个工程师在 AI 时代是否具备合格的工程素养:
能在 5 分钟内解释清楚自己的推理链路上的所有技术组件及其作用。不需要深入每个组件的源代码,但每个环节在什么条件下会出问题需要非常清晰。
能回答"这段推理代码在生产环境中会出什么问题"。不只是"网络不通怎么办",还要包括"GPU OOM 怎么办"、"模型版本不兼容怎么办"、"上游请求 token 数超限怎么办"。
能写出一段包含重试、超时、熔断的推理调用代码。不只是能调用 API,而是能在 API 不可用时让系统继续运行。
能根据普罗米修斯指标定位一个推理延迟异常的原因。不只从 Grafana 面板上发现 P99 上去了,而是能顺藤摸瓜找到排队时间、推理时间、网络时间各自的变化趋势。
能在 Code Review 中发现 AI 生成代码的潜在问题。不只是格式和命名,还有隐含的资源泄漏、死循环触发条件、SQL N+1 查询、并发竞争条件。
能规划一个模型从开发到生产全流程所需要做的工作。不只是写 Prompt,还包括部署方式、资源估算、监控指标设计、降级策略、灰度发布计划。
四、素养的培养路径
AI 时代的工程师素养不是一蹴而就的。以下是经过验证的三阶段培养路径:
第一阶段(1-3 月):在现有工作流中引入 AI 工具。把 Copilot 当成一个高级的自动补全来用,但每段生成的代码都过一遍完整的代码审查流程。目标是建立对 AI 生成代码质量的基本判断力。
第二阶段(3-6 月):参与 AI 服务的基础设施建设。从部署一个 vLLM 实例开始,配置 GPU 资源限制、接入 Prometheus 监控、设计健康检查规则。目标是建立对 AI 推理全链路的技术认知。
第三阶段(6-12 月):独立负责一个 AI 功能的端到端交付。从需求分析开始,到模型选型、推理部署、可观测性、上线后的稳定性——完整的生命周期。目标是建立系统思维和可靠性意识。
五、总结
AI 时代的工程师素养,前缀是 AI,核心是工程。会用模型写代码是这个时代的最低门槛,能在模型出问题时把系统兜住才是真正的竞争力。
服务可靠性的要求从来不会因为工具的进步而降低——恰恰相反,工具越强大,交付节奏越快,出问题的概率就越高,你的兜底能力就越重要。
基础设施不需要漂亮话。好的工程师,是在 AI 帮你写完代码之后,低头把测试写了、把监控埋了、把降级逻辑补上、把故障预案过了一遍的那个人。
资料说明
本文中的协议、版本、性能、成本和行业趋势应以可核验的一手资料为准。未标注统计口径的比例、时间表和预测仅作工程讨论,不应视为行业事实。可参考 0731 资料来源索引,并在发布前将具体来源贴到对应断言之后。