LLMPod

快速开始

从一台裸机 GPU 服务器到第一个可调用的推理端点,全程只需要几条命令。这一节把完整链路走一遍:安装控制面、引导节点、部署模型、发起调用。

本节内容

01

安装与初始化

一行安装脚本拉起控制面,检查系统依赖与端口要求。

在准备作为控制面的机器上(可以是任意一台 Linux 服务器,无需 GPU)执行安装脚本,脚本会自动检查系统依赖、内核参数与端口占用,然后拉起控制面服务。

curl -fsSL https://llmpod.cn/src/download/install.sh | sh

安装完成后终端会输出控制台地址与初始管理员凭据。控制面默认监听 8443 端口;如果机器有防火墙,放行该端口即可在浏览器打开控制台。

控制面自身是无状态服务,集群的全部状态(节点、模型、部署、端点)存储在本地元数据库中,单机即可运行,不需要外部依赖。

02

引导第一个 GPU 节点

在节点上执行引导脚本,等待拓扑自动注册与就绪检查。

在控制台「集群管理」里创建一个集群(例如 prod-a),然后拿到一条节点引导命令。把它复制到 GPU 节点上执行:

llmpod node bootstrap \
  --server=api.llmpod.cn:8443 \
  --pool=prod-a \
  --token=bt_xxxx

引导脚本会在节点上完成三件事:安装节点侧运行时、上报硬件拓扑(GPU 型号、显存、互联带宽)、注册进集群拓扑。全程不需要人工配置。

引导令牌在 8 小时内可重复使用,多台机器可以复用同一条命令批量接入。节点注册完成后,控制台的拓扑图里会立即出现这台机器,并开始上报 GPU 利用率、显存、温度等实时指标。

03

部署第一个模型

选择模型源、完成预检并启动推理服务。

进入「模型管理 → 添加模型」,选择模型源:HuggingFace 仓库、对象存储地址或本地文件上传均支持,大文件走分片上传与断点续传。

上传完成后创建部署。部署前的预检会校验:单卡显存余量是否够放模型、副本与卡数的放置规划、模型清单完整性。预检不通过会直接给出原因与建议配置,避免传完几十 GB 才发现跑不起来。

推理引擎按模型自动推荐 vLLM 或 TGI,也允许手动覆盖并行策略(张量并行 / 数据并行)。点击确认部署后,实例进入启动阶段,日志实时可见,就绪后自动接入你指定的端点。

04

发起第一次调用

创建 API Key,绑定端点,用 OpenAI 兼容格式发起推理请求。

在「密钥管理」创建一个 API Key(可设预算上限与有效期),然后在路由网关里确认端点已绑定刚部署的模型实例。端点地址形如 api.llmpod.cn,路径与 OpenAI 兼容:

curl https://api.llmpod.cn/v1/chat/completions \
  -H "Authorization: Bearer lp-xxxx" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen/Qwen2.5-7B-Instruct",
    "messages": [{"role": "user", "content": "你好"}]
  }'

流式响应(stream: true)与对话、补全两种接口都支持。调用完成后,在控制台的调用日志里可以看到每次请求的 token 用量、延迟与计费明细。

到这里,从裸机到可调用推理 API 的完整链路已经跑通。后续可以按「集群管理」「模型部署」「路由网关」各节深入了解每个环节。

没找到想要的

在社区论坛提问,或直接联系支持团队,多数问题在一个工作日内有回复。