我花 300 块租了张显卡,把大模型部署踩了 8 个坑
备课「AI 基础设施运维」这块,我不想纸上谈兵,自己花 300 块按量租了张显卡,从开机到把一个开源大模型跑起来对外提供服务,全程踩坑记录如下。300 块买这些教训,值。
坑 1:显存先算账,后开机
7B 模型半精度,光权重就 14GB,我第一台租的是 16GB 显存的卡——权重加上 KV Cache 直接爆。租卡之前先算:权重大小 + 推理时的缓存开销,留 20% 余量。
坑 2:驱动和 CUDA 版本错配
镜像里 CUDA 12.4,推理框架要 12.1+,启动就报符号找不到。教训:先定框架版本,再选镜像,别反过来。
坑 3:模型下载慢到怀疑人生
官方源拉 14GB 权重,龟速。换国内镜像源,40 分钟变 4 分钟。这条不值钱,但新手真会在这干等一晚上。
坑 4:vLLM 启动参数抄不得
vllm serve Qwen2.5-7B-Instruct --max-model-len 4096 --gpu-memory-utilization 0.85--max-model-len 不设,默认拉满上下文,显存直接打爆;设太小,长文本被截断。每个参数都要知道它动了什么,这是运维和「会跑 Demo」的分水岭。
坑 5:服务起来了,外面访问不到
端口监听了,防火墙没放;防火墙放了,云平台安全组没开。三层各管各的。排查口诀:进程 → 本机防火墙 → 平台安全组,一层层来。
坑 6:并发一上来,延迟炸了
单请求飞快,十个并发排队到天荒地老。这才理解为什么生产上要谈吞吐、批处理、量化——「能跑」和「能用」之间隔着整个运维岗。
坑 7:忘关机,账单教我做人
按量付费,测试完没释放,睡一觉两杯咖啡钱没了。现在我所有实验环境都设定时自动释放。这习惯在任何云上都值钱。
坑 8:没有监控,出问题全靠感觉
第二次部署我加了 GPU 监控:显存占用、利用率、温度。看着曲线才知道瓶颈在显存带宽不在算力。没有监控的运维是盲人摸象,GPU 集群上这句话放大十倍。
为什么说这些坑值钱
这 8 个坑,对应的全是真实岗位能力:容量规划、环境管理、网络排查、性能压测、成本控制、监控告警。传统运维的那套方法论,在 AI 基础设施上一个不少,只是对象从 CPU 服务器换成了 GPU 集群。
这也是为什么我说:AI 不会取代运维,但会取代不懂 GPU 的运维。下一篇展开讲这句话。