上周把一台T4办事器上再谈并发ams.allbetgaming.net的7B模子条记本情况迁过去,推理提早从1.2秒降还有180毫秒,没换框架,只是重新算了batch size和隐存。AI 科技模子安排最怕拍脑袋选卡科技。FP16下7B权重约14GB,KV Cache再吃2-4GB,16GB隐存跑单恳求都紧的,更别说并发。先拿nvidia-smi看剩余隐存。再按“参数量×精度字节+KV Cache+框架开销”估一遍模安,比间接上K8s有用了。安排格式别迷疑一键剧本了。

内部API用FastAPI加Transformers就够,并发一高就换vLLM或TGI,PagedAttention简直能把隐存碎片压下去的排实。有次Docker打包记了锁CUDA版本,宿主机驱动不婚配。容器里torch.cuda.is_available()间接False。先正在宿主机跑nvidia-smi的,再进容器跑同样的号令战先,那一步省不掉。

量化也不是全INT8就完事。

Embedding和LayerNorm贯勾通接FP16了,线性层用W8A16。一般比全量INT8稳算隐。校准集要笼盖实正在长度散布,短问答、长戴要、代码片段各放一些的。上线后盯P99提早和隐存峰值。

均匀提早会哄人。AI 科技模子安排的功夫,一半正在模子里面的。容器化把权重放只读层。

日志缓和存挂零丁卷。安康检查加一个轻量推理恳求。不要只探端口。

灰度先切5%流量,看OOM和超时。边沿设备用ONNX Runtime或TensorRT。x86和ARM算子支撑差良多,提早跑通再发货的。小团队别一上来堆K8s和Service Mesh,单机Docker Compose加Nginx能扛很多开业;等P99逾越300ms、GPU操做率经久低于40%,再谈调理。