模型部署
模型从文件到推理服务的完整生命周期:上传与断点续传、部署前预检、引擎参数选择、运行日志与扩缩容。
本节内容
01
模型上传
本地与远程模型源,大文件切片上传与断点续传。
添加模型时可选三种源:HuggingFace 仓库标识(自动探测格式与架构)、对象存储直链、本地文件上传。上传前会先做清单预检,探测权重格式(safetensors / GGUF 等)与模型架构,回填到模型信息里。
本地大文件走分片上传,断点续传由分片粒度保证——网络中断后重传命令会从上次完成的分片继续,不需要从头再来。
02
部署预检
显存与算力校验、推荐配置生成、拓扑预览,避免传完几十 GB 才发现跑不起来。
确认部署页会展示预检结果:单卡显存余量、放置规划(副本数 × 每副本卡数)、模型清单校验。任一项不通过都无法进入启动,且会给出建议配置(例如「张量并行 4 卡可留出 18.6 GB 余量」)。
预检同时生成拓扑预览:这份部署会落在哪些节点、占用哪些卡,与现有部署有无冲突一目了然。
03
推理引擎与并行策略
vLLM / TGI 引擎选择,张量并行与数据并行的适用场景。
默认按模型架构推荐引擎:追求吞吐的对话模型推荐 vLLM(PagedAttention 连续批处理),部分小模型或特定格式推荐 TGI。两者对外都暴露 OpenAI 兼容接口,切换引擎不需要改调用方代码。
并行策略上,单卡放不下的大模型用张量并行(权重切到多卡),吞吐不足时用数据并行(多副本各持完整权重)。预检会按显存自动推荐组合。
04
日志与扩缩容
实例运行日志排查,按负载扩容与缩容副本。
每个部署实例的启动日志与运行日志实时可查,按副本独立过滤。启动失败(依赖缺失、端口冲突、显存不足)在日志首屏即可定位。
副本数可随时调整:扩容按预检的放置规划落到新卡上,缩容先摘流量再停实例,进行中的请求不会被掐断。